T5 (Text-to-Text Transfer Transformer) (TL)
T5 (Text-to-Text Transfer Transformer) — ito ay isang pamilya ng malalaking language model na binuo ng mga mananaliksik ng Google AI at ipinakita noong 2019[1]. Ang pangunahing inobasyon ng T5 — ito ay isang pinag-isang framework na «text-to-text», na itinuturing ang anumang gawain sa natural language processing (NLP) bilang problema ng pagbabago ng isang text sequence patungo sa isa pa. Nagbigay-daan ito sa paggamit ng iisang modelo, loss function, at pamamaraan ng pagsasanay para sa malawak na hanay ng mga gawain, tulad ng pagsasalin, summarization, pagsagot sa mga tanong, at klasipikasyon[2].
Ang modelo ay nakabatay sa karaniwang arkitektura ng transformer na «encoder-decoder», na nagtatangi sa kanya mula sa mga modelong tulad ng BERT (encoder lamang) at GPT (decoder lamang). Ang gawain sa T5 ay pinagisipan bilang isang malawak na empirical na pananaliksik para sa sistematikong pag-aaral at paghahambing ng iba't ibang pamamaraan ng transfer learning sa NLP, at hindi bilang paglikha ng isang bagong pangunahing pamamaraan[1].
Paradigma ng «Text-to-Text»
Ang sentral na ideya ng T5 ay ang lahat ng gawain ay binubuo sa iisang format. Ang modelo ay tumatanggap ng teksto bilang input at bumubuo rin ng teksto bilang output. Upang matukoy ng modelo ang mga gawaing itinakda sa kanya, isang espesyal na tekstwal na prefix-instruksyon ang idinaragdag sa input sequence[2].
- Pagsasalin: `translate English to German: That is good.` → `Das ist gut.`
- Klasipikasyon ng tonalidad: `sst2 sentence: a very exciting film.` → `positive`
- Summarization: `summarize: [mahabang teksto ng artikulo]` → `[maikling buod]`
Ang diskarteng ito ay radikal na nagpapasimple ng proseso ng paglalapat ng modelo, na inaalis ang pangangailangan para sa pagbuo ng mga espesipikong «ulo» (task-specific heads) para sa bawat indibidwal na gawain, na katangian ng mga arkitektura tulad ng BERT[3].
Arkitektura at Sukat
Arkitektura ng encoder-decoder
Ginagamit ng T5 ang karaniwang arkitektura ng transformer, na binubuo ng dalawang bahagi[1]:
- Encoder: Pinoproseso ang buong input sequence nang sabay-sabay, na lumilikha ng mayamang contextualized na representasyon. Tulad ng sa BERT, ang encoder ng T5 ay bidirectional.
- Decoder: Bumubuo ng output text token sa bawat token (autoregresiyon), gamit ang representasyong natanggap mula sa encoder.
Ang hybrid na istrukturang ito ay nagbibigay-daan sa T5 na epektibong malutas ang parehong mga gawain sa pag-unawa sa wika at mga gawain sa pagbuo ng teksto[4].
Mga Pangunahing Pagpapabuti
Ang arkitektura ng T5 ay nagsasama ng ilang pagbabago kumpara sa orihinal na modelo ng transformer:
- Relative positional embeddings: Sa halip na absolute sinusoidal embeddings, gumagamit ang T5 ng pinasimple ngunit epektibong anyo ng relative position encoding, kung saan isang naaral na scalar bias na nakadepende lamang sa relatibong distansya sa pagitan ng mga token ay idinaragdag sa attention logits[1].
- Binagong Layer Normalization (Layer Norm): Ang normalisasyon ay inilipat sa labas ng residual connection, at inalis ang additive bias mula rito para sa higit na katatagan ng pagsasanay.
Mga Sukat ng Modelo
Sa orihinal na gawain, ang modelo ay ipinakita sa ilang mga configuration na naiiba sa bilang ng mga parameter, na nagbigay-daan sa sistematikong pag-aaral ng epekto ng sukat[5]:
- T5-Small: ~60 milyong parameter
- T5-Base: ~220 milyong parameter
- T5-Large: ~770 milyong parameter
- T5-3B: ~3 bilyong parameter
- T5-11B: ~11 bilyong parameter
Ipinakita ng pananaliksik na ang pagpapalaki ng sukat ng modelo ay isa sa pinaka-maaasahang paraan upang mapahusay ang pagganap nito[1].
Pre-training: Dataset C4 at Gawaing Span Corruption
Gawaing Span Corruption
Para sa pre-training ng T5, pinili ang gawaing denoising, lalo na ang espesipikong variant nito na tinatawag na span corruption (pagkasira ng fragment)[6]. Ang pamamaraan ay gumagana tulad ng sumusunod:
- Sa input text, 15% ng mga token ay random na natatakpan.
- Hindi katulad ng paraan ng MLM sa BERT, kung saan ang mga indibidwal na token ay natatakpan, sa T5 ang mga buong tuluy-tuloy na fragment (spans) ang natatakpan.
- Ang bawat sirang fragment ay pinapalitan ng isang natatanging mask token (halimbawa, `<X>`, `<Y>`).
- Ang modelo ay sinasamahan upang bumuo bilang output ng isang sequence ng mga tinanggal na fragment, na pinaghihiwalay ng kaukulang mga mask.
Ang diskarteng ito ay nagpipilit sa modelo na hulaan ang buong sequence ng teksto, na naging mas epektibong gawain para sa pre-training kaysa sa simpleng language modeling[1].
Dataset C4 (Colossal Clean Crawled Corpus)
Upang matupad ang potensyal ng transfer learning, lumikha ang mga mananaliksik ng napakalaki at mataas na kalidad na na-filter na koleksyon ng tekstwal na data na C4, na may sukat na humigit-kumulang 750 GB[2]. Ito ay nakuha sa pamamagitan ng malawak na paglilinis at pag-filter ng pampublikong web corpus na Common Crawl[7]. Ang proseso ng paglilinis ay kinabibilangan ng pag-alis ng mga duplicate, template na teksto ("Lorem ipsum"), hindi kumpleto na mga pangungusap, pati na rin ang pag-filter ng mapanghimasok na bokabularyo[8].
Kritisismo sa Dataset C4
Sa kabila ng idineklara na layunin ng paglikha ng isang «malinis» na corpus, ang proseso ng pag-filter ng C4 ay napuna dahil sa mga sistematikong bias. Ipinakita ng mga pananaliksik na ang filter ng mapanghimasok na bokabularyo ay hindi proporsyonal na nag-alis ng mga teksto na may kaugnayan sa mga komunidad ng LGBTQ+, pati na rin ang mga teksto sa African American English (AAE)[8]. Bukod dito, isang malaking halaga ng nakakasakit at content na protektado ng copyright ang natuklasan sa dataset. Ang mga problemang ito ay naglalarawan ng pagiging kumplikado ng paglikha ng obhetibong «mataas na kalidad» na mga dataset at kung paano ang mga teknikal na desisyon sa pag-filter ay maaaring humantong sa hindi sinasadyang social bias.
Mga Resulta at Pagganap
Sa oras ng publikasyon, ang T5 ay nagtakda ng mga bagong rekord ng pagganap (state-of-the-art) sa maraming benchmark, kabilang ang GLUE, SuperGLUE, SQuAD at mga gawain sa summarization[2]. Sa partikular, ang modelo na T5-11B ay nakamit sa SuperGLUE ang resulta na malapit sa antas ng tao, na nagpapakita ng kakayahang harapin ang mga gawaing nangangailangan ng kumplikadong lohikal na inferencing[9]. Ang mga resultang ito ay nagkumpirma ng sentral na hipotesis ng pananaliksik: ang kombinasyon ng pinag-isang framework, malaking sukat, at mataas na kalidad na dataset ay isang napakalakas na estratehiya para sa pagkamit ng mga nangungunang resulta sa NLP.
Ebolusyon at mga Variant ng T5
Ang diskarte ng T5 ay nagsilbing batayan para sa maraming kasunod na modelo:
- mT5: Multilingual na bersyon ng T5, na sinanay sa corpus na mC4, na sumasaklaw sa 101 wika[10].
- ByT5: Eksperimentong bersyon na ganap na tumatanggi sa tokenization at direktang nagtatrabaho sa mga hilaw na byte ng UTF-8. Ginagawa itong matibay laban sa mga typo at nagbibigay-daan sa pagproseso ng anumang wika nang «out of the box»[11].
- Switch Transformer: Scalable na bersyon ng T5 na nagpakilala ng arkitektura ng Mixture-of-Experts (MoE), na nagpahintulot sa pagpapalaki ng bilang ng mga parameter hanggang sa trilyon habang pinapanatili ang makatwirang computational na gastos[12].
- FLAN-T5: Hindi ito isang bagong arkitektura, kundi isang karaniwang T5 na dumaan sa karagdagang yugto ng fine-tuning sa daan-daang mga gawain na binuo bilang mga instruksyon (instruction tuning). Ito ay lubos na nagpabuti ng kakayahan nitong mag-generalize sa mga bago, hindi pa nakitang gawain sa mode na zero-shot (nang walang mga halimbawa)[13].
- UL2: Isang modelo na nagpapaunlad ng mga ideya ng T5, na gumagamit ng bagong pre-training objective na tinatawag na Mixture of Denoisers, na pinagsasama ang iba't ibang scheme ng text masking upang mapabuti ang universalidad[14].
Mga Sanggunian
- Opisyal na repository ng T5 sa GitHub
- Artikulo sa blog ng Google Research tungkol sa pananaliksik ng T5
Panitikan
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
- Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
- Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
- Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
- Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
- Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
- Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
- Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.
Mga Tala
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [1]
- ↑ 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [2]
- ↑ «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [3]
- ↑ «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [4]
- ↑ «T5». Hugging Face Transformers Documentation. [5]
- ↑ «T5 (language model)». In Wikipedia. [6]
- ↑ «C4 Dataset». Papers With Code. [7]
- ↑ 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [8]
- ↑ «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [9]
- ↑ Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [10]
- ↑ Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [11]
- ↑ Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [12]
- ↑ Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [13]
- ↑ Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [14]