---
title: "T5 (Text-to-Text Transfer Transformer) (BN)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7810
wiki_created_at: 2026-09-07T01:07:20Z
wiki_modified_at: 2026-09-07T01:07:20Z
downloaded_at: 2026-09-07T23:20:53Z
---

# T5 (Text-to-Text Transfer Transformer) (BN)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — এটি Google AI-এর গবেষকদের দ্বারা তৈরি এবং ২০১৯ সালে উপস্থাপিত বৃহৎ ভাষা মডেলের একটি পরিবার<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-raffel2020-1)</sup>। T5-এর মূল উদ্ভাবন হলো একটি একীভূত **«text-to-text»** ফ্রেমওয়ার্ক, যা প্রাকৃতিক ভাষা প্রক্রিয়াকরণের (NLP) যেকোনো কাজকে একটি টেক্সট ক্রম থেকে আরেকটি টেক্সট ক্রমে রূপান্তরের সমস্যা হিসেবে বিবেচনা করে। এটি অনুবাদ, সারসংক্ষেপ, প্রশ্নোত্তর এবং শ্রেণিবিভাগের মতো বিস্তৃত কাজের জন্য একটি একক মডেল, একটি লস ফাংশন এবং একটি প্রশিক্ষণ পদ্ধতি ব্যবহার করার সুযোগ দিয়েছে<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-google-blog-t5-2)</sup>।

মডেলটি স্ট্যান্ডার্ড transformer «এনকোডার-ডিকোডার» আর্কিটেকচারের উপর ভিত্তি করে তৈরি, যা এটিকে BERT (শুধুমাত্র এনকোডার) এবং GPT (শুধুমাত্র ডিকোডার) ধরনের মডেলগুলো থেকে আলাদা করে। T5-এর কাজটি মূলত NLP-তে transfer learning-এর বিভিন্ন পদ্ধতি পদ্ধতিগতভাবে অধ্যয়ন ও তুলনা করার জন্য একটি বৃহৎ মাপের অভিজ্ঞতামূলক গবেষণা হিসেবে পরিকল্পিত হয়েছিল, কোনো মৌলিকভাবে নতুন পদ্ধতি তৈরি করার জন্য নয়<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-raffel2020-1)</sup>।

## «Text-to-Text» প্যারাডাইম

T5-এর কেন্দ্রীয় ধারণা হলো সমস্ত কাজ একটি একক ফরম্যাটে প্রণয়ন করা হয়। মডেলটি ইনপুট হিসেবে টেক্সট গ্রহণ করে এবং আউটপুট হিসেবেও টেক্সট তৈরি করে। মডেলটি যাতে তার সামনে রাখা কাজগুলো পার্থক্য করতে পারে, সেজন্য ইনপুট ক্রমে একটি বিশেষ টেক্সট **প্রিফিক্স-নির্দেশনা** যুক্ত করা হয়<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-google-blog-t5-2)</sup>।

- **অনুবাদ**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **অনুভূতি শ্রেণিবিভাগ**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **সারসংক্ষেপ**: \`summarize: \[দীর্ঘ নিবন্ধের টেক্সট\]\` → \`\[সংক্ষিপ্ত বিবরণ\]\`

এই পদ্ধতিটি মডেলের প্রয়োগ প্রক্রিয়াকে আমূলভাবে সহজ করে, প্রতিটি পৃথক কাজের জন্য নির্দিষ্ট «হেড» (*task-specific heads*) তৈরির প্রয়োজনীয়তা দূর করে, যা BERT-এর মতো আর্কিটেকচারের বৈশিষ্ট্য ছিল<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-dhiwise-t5-3)</sup>।

## আর্কিটেকচার এবং স্কেলিং

### এনকোডার-ডিকোডার আর্কিটেকচার

T5 দুটি অংশ নিয়ে গঠিত স্ট্যান্ডার্ড transformer আর্কিটেকচার ব্যবহার করে<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-raffel2020-1)</sup>:

- **এনকোডার**: সম্পূর্ণ ইনপুট ক্রমটি একসাথে প্রক্রিয়া করে, একটি সমৃদ্ধ প্রাসঙ্গিক উপস্থাপনা তৈরি করে। BERT-এর মতোই, T5-এর এনকোডার **দ্বিমুখী**।
- **ডিকোডার**: এনকোডার থেকে প্রাপ্ত উপস্থাপনা ব্যবহার করে টোকেন দ্বারা টোকেন (অটোরিগ্রেসিভভাবে) আউটপুট টেক্সট তৈরি করে।

এই হাইব্রিড কাঠামো T5-কে ভাষা বোঝার কাজ এবং টেক্সট তৈরির কাজ উভয়ই কার্যকরভাবে সমাধান করতে সক্ষম করে<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-gfg-t5-4)</sup>।

### মূল উন্নতিসমূহ

T5-এর আর্কিটেকচারে মূল transformer মডেলের তুলনায় কিছু পরিবর্তন অন্তর্ভুক্ত রয়েছে:

- **আপেক্ষিক পজিশনাল embedding**: পরম সাইনুসয়েডাল embedding-এর পরিবর্তে T5 আপেক্ষিক পজিশন এনকোডিংয়ের একটি সরলীকৃত কিন্তু কার্যকর রূপ ব্যবহার করে, যেখানে attention লজিটে একটি প্রশিক্ষণযোগ্য স্কেলার বায়াস (bias) যোগ করা হয় যা কেবল টোকেনগুলোর মধ্যে আপেক্ষিক দূরত্বের উপর নির্ভর করে<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-raffel2020-1)</sup>।
- **পরিবর্তিত Layer Norm**: নর্মালাইজেশন residual connection-এর বাইরে নেওয়া হয়েছে এবং প্রশিক্ষণের স্থিতিশীলতা বাড়াতে এর থেকে অ্যাডিটিভ বায়াস (bias) সরানো হয়েছে।

### মডেলের আকার

মূল গবেষণাপত্রে মডেলটি বেশ কয়েকটি কনফিগারেশনে উপস্থাপন করা হয়েছিল, যেগুলো প্যারামিটারের সংখ্যায় ভিন্ন, যা স্কেলের প্রভাব পদ্ধতিগতভাবে অধ্যয়ন করার সুযোগ দিয়েছে<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~৬ কোটি প্যারামিটার
- **T5-Base**: ~২২ কোটি প্যারামিটার
- **T5-Large**: ~৭৭ কোটি প্যারামিটার
- **T5-3B**: ~৩০০ কোটি প্যারামিটার
- **T5-11B**: ~১১০০ কোটি প্যারামিটার

গবেষণায় দেখা গেছে যে মডেলের স্কেল বৃদ্ধি করা এর কার্যক্ষমতা উন্নত করার সবচেয়ে নির্ভরযোগ্য উপায়গুলোর মধ্যে একটি<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-raffel2020-1)</sup>।

## প্রি-ট্রেনিং: C4 dataset এবং Span Corruption কাজ

### Span Corruption কাজ

T5-এর প্রি-ট্রেনিংয়ের জন্য একটি denoising কাজ বেছে নেওয়া হয়েছিল, বিশেষভাবে এর **ফ্র্যাগমেন্ট ক্ষতি (span corruption)** নামক রূপ<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-t5-wikipedia-6)</sup>। পদ্ধতিটি নিম্নরূপ কাজ করে:

1.  ইনপুট টেক্সটে এলোমেলোভাবে ১৫% টোকেন মাস্ক করা হয়।
2.  BERT-এর MLM পদ্ধতির বিপরীতে, যেখানে পৃথক টোকেন মাস্ক করা হয়, T5-এ সম্পূর্ণ ধারাবাহিক ফ্র্যাগমেন্ট (*spans*) মাস্ক করা হয়।
3.  প্রতিটি ক্ষতিগ্রস্ত ফ্র্যাগমেন্টকে একটি অনন্য মাস্ক-টোকেন দিয়ে প্রতিস্থাপিত করা হয় (যেমন \`\<X\>\`, \`\<Y\>\`)।
4.  মডেলটি আউটপুটে সংশ্লিষ্ট মাস্ক দ্বারা পৃথক করা মুছে ফেলা ফ্র্যাগমেন্টগুলোর ক্রম তৈরি করতে শিখে।

এই পদ্ধতিটি মডেলকে সম্পূর্ণ টেক্সট ক্রম পূর্বাভাস দিতে বাধ্য করে, যা সাধারণ ভাষা মডেলিংয়ের চেয়ে প্রি-ট্রেনিংয়ের জন্য আরও কার্যকর কাজ হিসেবে প্রমাণিত হয়েছে<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-raffel2020-1)</sup>।

### C4 Dataset (Colossal Clean Crawled Corpus)

ট্রান্সফার লার্নিংয়ের সম্ভাবনা উপলব্ধি করতে গবেষকরা প্রায় ৭৫০ গিগাবাইট আয়তনের একটি বিশাল এবং মানসম্পন্নভাবে পরিষ্কার করা টেক্সট ডেটার সংগ্রহ **C4** তৈরি করেছিলেন<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-google-blog-t5-2)</sup>। এটি সর্বজনীনভাবে উপলব্ধ ওয়েব কর্পাস **Common Crawl**-এর বৃহৎ মাপের পরিষ্কার এবং ফিল্টারিংয়ের মাধ্যমে প্রাপ্ত হয়েছিল<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-c4-dataset-pwc-7)</sup>। পরিষ্কার করার প্রক্রিয়ায় ডুপ্লিকেট, ছাঁচের টেক্সট ("Lorem ipsum"), অসম্পূর্ণ বাক্য অপসারণ এবং অশ্লীল ভাষা ফিল্টার করা অন্তর্ভুক্ত ছিল<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-dodge2021-doc-c4-8)</sup>।

### C4 Dataset-এর সমালোচনা

«পরিষ্কার» কর্পাস তৈরির ঘোষিত লক্ষ্য সত্ত্বেও, C4-এর ফিল্টারিং প্রক্রিয়া পদ্ধতিগত পক্ষপাতের জন্য সমালোচিত হয়েছে। গবেষণায় দেখা গেছে যে অশ্লীল ভাষার ফিল্টারটি LGBTQ+ সম্প্রদায়ের সাথে সম্পর্কিত টেক্সট এবং আফ্রিকান-আমেরিকান ইংরেজি (AAE)-তে লেখা টেক্সট অসামঞ্জস্যপূর্ণভাবে সরিয়ে দিয়েছিল<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-dodge2021-doc-c4-8)</sup>। এছাড়াও, dataset-এ উল্লেখযোগ্য পরিমাণ আপত্তিকর এবং কপিরাইটযুক্ত কন্টেন্ট পাওয়া গেছে। এই সমস্যাগুলো উদ্দেশ্যমূলকভাবে «মানসম্পন্ন» ডেটাসেট তৈরির জটিলতা এবং ফিল্টারিংয়ের প্রযুক্তিগত সিদ্ধান্তগুলো কীভাবে অনিচ্ছাকৃত সামাজিক পক্ষপাত তৈরি করতে পারে তা চিত্রিত করে।

## ফলাফল এবং কার্যক্ষমতা

প্রকাশনার সময়ে T5 **GLUE**, **SuperGLUE**, **SQuAD** এবং সারসংক্ষেপ কাজ সহ অনেক benchmark-এ নতুন কার্যক্ষমতার রেকর্ড (*state-of-the-art*) স্থাপন করেছিল<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-google-blog-t5-2)</sup>। বিশেষভাবে, **T5-11B** মডেলটি **SuperGLUE**-এ মানব-স্তরের কাছাকাছি ফলাফল অর্জন করেছে, জটিল যৌক্তিক অনুমান প্রয়োজন এমন কাজ সমাধানের ক্ষমতা প্রদর্শন করেছে<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-reddit-superglue-t5-9)</sup>। এই ফলাফলগুলো গবেষণার কেন্দ্রীয় অনুকল্পটি নিশ্চিত করেছে: একীভূত ফ্রেমওয়ার্ক, বৃহৎ স্কেল এবং মানসম্পন্ন ডেটাসেটের সমন্বয় NLP-তে অগ্রণী ফলাফল অর্জনের জন্য একটি অত্যন্ত শক্তিশালী কৌশল।

## T5-এর বিবর্তন এবং রূপভেদ

T5-এর পদ্ধতি অসংখ্য পরবর্তী মডেলের ভিত্তি হিসেবে কাজ করেছে:

- **mT5**: T5-এর বহুভাষিক সংস্করণ, **১০১টি ভাষা** জুড়ে বিস্তৃত **mC4** কর্পাসে প্রশিক্ষিত<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-xue2020-mt5-10)</sup>।
- **ByT5**: একটি পরীক্ষামূলক সংস্করণ যা সম্পূর্ণরূপে টোকেনাইজেশন বাদ দিয়ে সরাসরি **কাঁচা UTF-8 বাইটের** সাথে কাজ করে। এটি এটিকে টাইপোগ্রাফিক ত্রুটির প্রতি প্রতিরোধী করে তোলে এবং যেকোনো ভাষা «বাক্সের বাইরে» প্রক্রিয়া করার সুযোগ দেয়<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-xue2022-byt5-11)</sup>।
- **Switch Transformer**: T5-এর একটি স্কেলযোগ্য সংস্করণ যা **Mixture-of-Experts (MoE)** আর্কিটেকচার চালু করেছে, যা যুক্তিসঙ্গত গণনামূলক খরচ বজায় রেখে প্যারামিটারের সংখ্যা ট্রিলিয়নে বাড়ানোর সুযোগ দিয়েছে<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-fedus2021-switch-12)</sup>।
- **FLAN-T5**: এটি কোনো নতুন আর্কিটেকচার নয়, বরং এটি স্ট্যান্ডার্ড T5 যা নির্দেশনা আকারে প্রণীত (*instruction tuning*) শত শত কাজের উপর অতিরিক্ত fine-tuning পর্যায়ের মধ্য দিয়ে গেছে। এটি **zero-shot** মোডে (উদাহরণ ছাড়া) নতুন, অদেখা কাজে সাধারণীকরণের ক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধি করেছে<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-chung2022-flan-13)</sup>।
- **UL2**: T5-এর ধারণাগুলো বিকশিত করা একটি মডেল, যা **Mixture of Denoisers** নামক একটি নতুন প্রি-ট্রেনিং অবজেক্টিভ ব্যবহার করে, সার্বজনীনতা উন্নত করতে বিভিন্ন টেক্সট মাস্কিং স্কিম একত্রিত করে<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_note-tay2022-ul2-14)</sup>।

## তথ্যসূত্র

- GitHub-এ T5-এর অফিসিয়াল রিপোজিটরি
- T5 গবেষণা সম্পর্কে Google Research ব্লগের নিবন্ধ

## সাহিত্য

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## টীকা

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[১]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[২]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[৩]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[৪]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[৫]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[৬]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[৭]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[৮]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[৯]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[১০]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[১১]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[১২]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[১৩]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BN)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[১৪]</a></span>
