---
title: "T5 (Text-to-Text Transfer Transformer) (HI)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(HI)"
language: "hi"
categories:
  - "Category:Google"
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7818
wiki_created_at: 2026-09-07T01:07:27Z
wiki_modified_at: 2026-09-07T01:07:27Z
downloaded_at: 2026-09-07T23:20:57Z
---

# T5 (Text-to-Text Transfer Transformer) (HI)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — यह Google AI के शोधकर्ताओं द्वारा विकसित और 2019 में प्रस्तुत किए गए बड़े भाषा मॉडलों का एक परिवार है<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-raffel2020-1)</sup>। T5 का मुख्य नवाचार **«text-to-text»** का एकीकृत framework है, जो प्राकृतिक भाषा प्रसंस्करण (NLP) की किसी भी समस्या को एक पाठ अनुक्रम को दूसरे में रूपांतरित करने की समस्या के रूप में देखता है। इससे अनुवाद, सारांशीकरण, प्रश्नोत्तर और वर्गीकरण जैसे व्यापक कार्यों के लिए एकल मॉडल, हानि फ़ंक्शन और प्रशिक्षण प्रक्रिया का उपयोग संभव हुआ<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-google-blog-t5-2)</sup>।

यह मॉडल मानक encoder-decoder transformer architecture पर आधारित है, जो इसे BERT (केवल encoder) और GPT (केवल decoder) जैसे मॉडलों से अलग करता है। T5 पर कार्य को NLP में transfer learning की विभिन्न विधियों के व्यवस्थित अध्ययन और तुलना के लिए एक बड़े पैमाने के अनुभवजन्य अनुसंधान के रूप में परिकल्पित किया गया था, न कि किसी मौलिक रूप से नई पद्धति के निर्माण के रूप में<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-raffel2020-1)</sup>।

## «Text-to-Text» प्रतिमान

T5 का केंद्रीय विचार यह है कि सभी कार्यों को एकसमान प्रारूप में तैयार किया जाता है। मॉडल इनपुट के रूप में पाठ प्राप्त करता है और आउटपुट के रूप में भी पाठ उत्पन्न करता है। मॉडल को दिए गए कार्यों में अंतर करने में सक्षम बनाने के लिए, इनपुट अनुक्रम में एक विशेष पाठ **उपसर्ग-निर्देश** जोड़ा जाता है<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-google-blog-t5-2)</sup>।

- **अनुवाद**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **भाव वर्गीकरण**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **सारांशीकरण**: \`summarize: \[लंबा लेख पाठ\]\` → \`\[संक्षिप्त सारांश\]\`

यह दृष्टिकोण मॉडल के अनुप्रयोग की प्रक्रिया को आमूल रूप से सरल बनाता है, प्रत्येक अलग कार्य के लिए विशिष्ट «हेड» (*task-specific heads*) विकसित करने की आवश्यकता को समाप्त करता है, जो BERT जैसी architectures की विशेषता थी<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-dhiwise-t5-3)</sup>।

## Architecture और स्केलिंग

### Encoder-Decoder Architecture

T5 मानक transformer architecture का उपयोग करता है, जिसमें दो भाग होते हैं<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-raffel2020-1)</sup>:

- **Encoder**: संपूर्ण इनपुट अनुक्रम को एक साथ संसाधित करता है, जिससे एक समृद्ध प्रासंगिक representation तैयार होती है। BERT की तरह, T5 का encoder **द्विदिशात्मक** है।
- **Decoder**: encoder से प्राप्त representation का उपयोग करते हुए, आउटपुट पाठ को token-दर-token (autoregressive रूप से) उत्पन्न करता है।

यह संकर संरचना T5 को भाषा बोधगम्यता और पाठ उत्पादन दोनों प्रकार के कार्यों को प्रभावी ढंग से हल करने में सक्षम बनाती है<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-gfg-t5-4)</sup>।

### प्रमुख सुधार

T5 की architecture में मूल transformer मॉडल की तुलना में कई परिवर्तन शामिल हैं:

- **सापेक्ष Positional Embeddings**: पूर्ण साइनसॉइडल embeddings के स्थान पर T5 सापेक्ष स्थिति कोडिंग के एक सरल किंतु प्रभावी रूप का उपयोग करता है, जहाँ attention logits में एक learnable scalar bias जोड़ा जाता है, जो केवल tokens के बीच की सापेक्ष दूरी पर निर्भर करता है<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-raffel2020-1)</sup>।
- **संशोधित Layer Normalization (Layer Norm)**: Normalization को residual connection के बाहर रखा गया है, और प्रशिक्षण स्थिरता बढ़ाने के लिए इससे additive bias हटा दिया गया है।

### मॉडल के आकार

मूल शोध में मॉडल को कई कॉन्फ़िगरेशन में प्रस्तुत किया गया था, जो पैरामीटरों की संख्या में भिन्न थे, जिससे स्केल के प्रभाव का व्यवस्थित अध्ययन संभव हुआ<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~6 करोड़ पैरामीटर
- **T5-Base**: ~22 करोड़ पैरामीटर
- **T5-Large**: ~77 करोड़ पैरामीटर
- **T5-3B**: ~3 अरब पैरामीटर
- **T5-11B**: ~11 अरब पैरामीटर

शोध से पता चला कि मॉडल के स्केल को बढ़ाना उसके प्रदर्शन में सुधार के सबसे विश्वसनीय तरीकों में से एक है<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-raffel2020-1)</sup>।

## पूर्व-प्रशिक्षण: C4 Dataset और Span Corruption कार्य

### Span Corruption कार्य

T5 के पूर्व-प्रशिक्षण के लिए noise हटाने (*denoising*) का कार्य चुना गया, विशेष रूप से इसका एक संस्करण जिसे **खंड क्षति (span corruption)** कहते हैं<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-t5-wikipedia-6)</sup>। यह विधि निम्न प्रकार कार्य करती है:

1.  इनपुट पाठ में 15% tokens को यादृच्छिक रूप से mask किया जाता है।
2.  BERT की MLM विधि के विपरीत, जहाँ अलग-अलग tokens को mask किया जाता है, T5 में पूरे निरंतर खंडों (*spans*) को mask किया जाता है।
3.  प्रत्येक क्षतिग्रस्त खंड को एक अद्वितीय mask token से बदला जाता है (उदाहरण के लिए, \`\<X\>\`, \`\<Y\>\`)।
4.  मॉडल को आउटपुट में हटाए गए खंडों का अनुक्रम उत्पन्न करने के लिए प्रशिक्षित किया जाता है, जो संबंधित masks द्वारा अलग किए जाते हैं।

यह दृष्टिकोण मॉडल को पाठ के पूरे अनुक्रमों की भविष्यवाणी करने के लिए बाध्य करता है, जो पूर्व-प्रशिक्षण के लिए सामान्य भाषा मॉडलिंग की तुलना में अधिक प्रभावी कार्य साबित हुआ<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-raffel2020-1)</sup>।

### C4 Dataset (Colossal Clean Crawled Corpus)

Transfer learning की संभावनाओं को साकार करने के लिए शोधकर्ताओं ने लगभग 750 GB आकार का एक विशाल और उच्च गुणवत्ता से साफ किया गया पाठ डेटा संग्रह **C4** बनाया<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-google-blog-t5-2)</sup>। इसे सार्वजनिक रूप से उपलब्ध वेब corpus **Common Crawl** की बड़े पैमाने पर सफाई और फ़िल्टरिंग द्वारा प्राप्त किया गया था<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-c4-dataset-pwc-7)</sup>। सफाई प्रक्रिया में डुप्लीकेट, शाब्लोनिक पाठ ("Lorem ipsum"), अधूरे वाक्यों को हटाना, तथा अश्लील शब्दावली की फ़िल्टरिंग शामिल थी<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-dodge2021-doc-c4-8)</sup>।

### C4 Dataset की आलोचना

«स्वच्छ» corpus बनाने के घोषित उद्देश्य के बावजूद, C4 की फ़िल्टरिंग प्रक्रिया पर व्यवस्थित पूर्वाग्रहों के कारण आलोचना हुई। अध्ययनों से पता चला कि अश्लील शब्दावली फ़िल्टर ने LGBTQ+ समुदायों से संबंधित पाठों के साथ-साथ अफ्रीकी-अमेरिकी अंग्रेज़ी (AAE) के पाठों को असमान रूप से हटा दिया<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-dodge2021-doc-c4-8)</sup>। इसके अतिरिक्त, dataset में आपत्तिजनक और कॉपीराइट-संरक्षित सामग्री की पर्याप्त मात्रा पाई गई। ये समस्याएं वस्तुनिष्ठ रूप से «गुणवत्तापूर्ण» dataset बनाने की जटिलता और फ़िल्टरिंग के तकनीकी निर्णयों से अनजाने में उत्पन्न होने वाले सामाजिक पूर्वाग्रहों को उजागर करती हैं।

## परिणाम और प्रदर्शन

प्रकाशन के समय T5 ने **GLUE**, **SuperGLUE**, **SQuAD** और सारांशीकरण कार्यों सहित अनेक benchmark पर नए प्रदर्शन रिकॉर्ड (*state-of-the-art*) स्थापित किए<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-google-blog-t5-2)</sup>। विशेष रूप से, **T5-11B** मॉडल ने **SuperGLUE** पर मानव स्तर के निकट परिणाम प्राप्त किया, जिससे जटिल तार्किक अनुमान की आवश्यकता वाले कार्यों को संभालने की उसकी क्षमता प्रदर्शित हुई<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-reddit-superglue-t5-9)</sup>। इन परिणामों ने शोध की केंद्रीय परिकल्पना की पुष्टि की: एकीकृत framework, बड़े स्केल और गुणवत्तापूर्ण dataset का संयोजन NLP में अग्रणी परिणाम प्राप्त करने के लिए एक अत्यंत शक्तिशाली रणनीति है।

## T5 का विकास और रूपांतर

T5 दृष्टिकोण ने अनेक परवर्ती मॉडलों का आधार बनाया:

- **mT5**: T5 का बहुभाषीय संस्करण, जिसे **101 भाषाओं** को कवर करने वाले **mC4** corpus पर प्रशिक्षित किया गया है<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-xue2020-mt5-10)</sup>।
- **ByT5**: एक प्रायोगिक संस्करण जो tokenization को पूरी तरह त्याग देता है और सीधे **कच्चे UTF-8 bytes** के साथ कार्य करता है। यह इसे टाइपो के प्रति प्रतिरोधी बनाता है और «बिना किसी सेटअप के» किसी भी भाषा को संसाधित करने में सक्षम बनाता है<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-xue2022-byt5-11)</sup>।
- **Switch Transformer**: T5 का एक स्केलेबल संस्करण, जिसने **Mixture-of-Experts (MoE)** architecture को लागू किया, जिससे उचित कम्प्यूटेशनल लागत बनाए रखते हुए पैरामीटरों की संख्या को ट्रिलियन तक बढ़ाना संभव हुआ<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-fedus2021-switch-12)</sup>।
- **FLAN-T5**: यह कोई नई architecture नहीं है, बल्कि मानक T5 है जो सैकड़ों कार्यों पर निर्देशों के रूप में तैयार किए गए अतिरिक्त fine-tuning चरण (*instruction tuning*) से गुज़री है। इससे **zero-shot** (बिना उदाहरणों के) मोड में नए, अनदेखे कार्यों पर सामान्यीकरण करने की उसकी क्षमता में उल्लेखनीय वृद्धि हुई<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-chung2022-flan-13)</sup>।
- **UL2**: T5 के विचारों को विकसित करने वाला एक मॉडल, जो **Mixture of Denoisers** नामक नए पूर्व-प्रशिक्षण objective का उपयोग करता है, जो बेहतर सार्वभौमिकता के लिए पाठ masking की विभिन्न योजनाओं को संयोजित करता है<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_note-tay2022-ul2-14)</sup>।

## संदर्भ

- GitHub पर T5 का आधिकारिक repository
- T5 शोध पर Google Research ब्लॉग पोस्ट

## साहित्य

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## टिप्पणियाँ

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[४]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[५]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[६]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[७]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[८]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[९]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[१०]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[११]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[१२]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[१३]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HI)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[१४]</a></span>
