---
title: "T5 (Text-to-Text Transfer Transformer) (CS)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7811
wiki_created_at: 2026-09-07T01:07:21Z
wiki_modified_at: 2026-09-07T01:07:21Z
downloaded_at: 2026-09-07T23:20:54Z
---

# T5 (Text-to-Text Transfer Transformer) (CS)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — je rodina velkých jazykových modelů vyvinutá výzkumníky Google AI a představená v roce 2019<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-raffel2020-1)</sup>. Klíčovou inovací T5 je unifikovaný framework **„text-to-text"**, který přistupuje k jakékoli úloze zpracování přirozeného jazyka (NLP) jako k problému převodu jedné textové sekvence na druhou. To umožnilo využívat jediný model, jednu ztrátovou funkci a jediný postup trénování pro široké spektrum úloh, jako je překlad, sumarizace, odpovídání na otázky a klasifikace<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-google-blog-t5-2)</sup>.

Model je založen na standardní architektuře transformeru „encoder-decoder", což jej odlišuje od modelů typu BERT (pouze encoder) a GPT (pouze decoder). Práce na T5 byla koncipována jako rozsáhlý empirický výzkum pro systematické studium a porovnání různých metod přenosového učení v NLP, nikoli jako vytvoření zásadně nové metody<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-raffel2020-1)</sup>.

## Paradigma „Text-to-Text"

Ústřední myšlenka T5 spočívá v tom, že všechny úlohy jsou formulovány v jednotném formátu. Model dostává na vstupu text a generuje na výstupu rovněž text. Aby model dokázal rozlišit zadané úlohy, je ke vstupní sekvenci přidána speciální textová **instrukce ve formě prefixu**<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-google-blog-t5-2)</sup>.

- **Překlad**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Klasifikace sentimentu**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Sumarizace**: \`summarize: \[dlouhý text článku\]\` → \`\[stručné shrnutí\]\`

Tento přístup radikálně zjednodušuje proces použití modelu, odstraňuje nutnost vývoje specifických „hlav" (*task-specific heads*) pro každou jednotlivou úlohu, což bylo typické pro architektury jako BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-dhiwise-t5-3)</sup>.

## Architektura a škálování

### Architektura encoder-decoder

T5 využívá standardní architekturu transformeru skládající se ze dvou částí<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-raffel2020-1)</sup>:

- **Encoder**: Zpracovává celou vstupní sekvenci najednou a vytváří bohaté kontextualizované reprezentace. Stejně jako v BERT je encoder T5 **obousměrný**.
- **Decoder**: Generuje výstupní text token po tokenu (autoregresivně) s využitím reprezentace získané od encoderu.

Tato hybridní struktura umožňuje T5 efektivně řešit jak úlohy porozumění jazyku, tak úlohy generování textu<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-gfg-t5-4)</sup>.

### Klíčová vylepšení

Architektura T5 zahrnuje několik změn oproti původnímu modelu transformeru:

- **Relativní poziční embedding**: Místo absolutních sinusoidálních embeddingů využívá T5 zjednodušenou, avšak účinnou formu relativního kódování pozice, kde jsou k logitům pozornosti přidávány trénovatelné skalární posuny (bias) závisející pouze na relativní vzdálenosti mezi tokeny<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-raffel2020-1)</sup>.
- **Upravená normalizace vrstev (Layer Norm)**: Normalizace je přesunuta mimo reziduální spojení (*residual connection*) a je z ní odstraněn aditivní posun (bias) pro zvýšení stability trénování.

### Velikosti modelu

V původní práci byl model představen v několika konfiguracích lišících se počtem parametrů, což umožnilo systematicky studovat vliv škálování<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 milionů parametrů
- **T5-Base**: ~220 milionů parametrů
- **T5-Large**: ~770 milionů parametrů
- **T5-3B**: ~3 miliardy parametrů
- **T5-11B**: ~11 miliard parametrů

Výzkum ukázal, že zvyšování velikosti modelu je jedním z nejspolehlivějších způsobů, jak zlepšit jeho výkonnost<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-raffel2020-1)</sup>.

## Předtrénování: dataset C4 a úloha Span Corruption

### Úloha Span Corruption

Pro předtrénování T5 byla zvolena úloha odšumování (*denoising*), konkrétně její specifická varianta nazývaná **poškozování fragmentů (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-t5-wikipedia-6)</sup>. Metoda funguje následovně:

1.  Ve vstupním textu je náhodně maskováno 15 % tokenů.
2.  Na rozdíl od metody MLM v BERT, kde jsou maskovány jednotlivé tokeny, jsou v T5 maskovány celé souvislé fragmenty (*spans*).
3.  Každý poškozený fragment je nahrazen jedním unikátním maskovacím tokenem (např. \`\<X\>\`, \`\<Y\>\`).
4.  Model je trénován generovat na výstupu sekvenci odstraněných fragmentů oddělených příslušnými maskami.

Tento přístup nutí model předpovídat celé sekvence textu, což se ukázalo jako účinnější předtréninkový úkol než prosté jazykové modelování<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-raffel2020-1)</sup>.

### Dataset C4 (Colossal Clean Crawled Corpus)

Pro realizaci potenciálu přenosového učení vytvořili výzkumníci rozsáhlý a kvalitně vyčištěný soubor textových dat **C4** o objemu přibližně 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-google-blog-t5-2)</sup>. Byl získán rozsáhlým čištěním a filtrováním veřejně dostupného webového korpusu **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-c4-dataset-pwc-7)</sup>. Proces čištění zahrnoval odstraňování duplicit, šablonových textů („Lorem ipsum"), neúplných vět a také filtrování nevhodného lexika<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-dodge2021-doc-c4-8)</sup>.

### Kritika datasetu C4

Navzdory deklarovanému cíli vytvořit „čistý" korpus byl proces filtrování C4 podroben kritice za systémové odchylky. Výzkumy ukázaly, že filtr nevhodného lexika nepřiměřeně odstraňoval texty spojené s LGBTQ+ komunitami a také texty v afroamerickém angličtině (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-dodge2021-doc-c4-8)</sup>. Kromě toho bylo v datasetu nalezeno značné množství urážlivého a autorskými právy chráněného obsahu. Tyto problémy ilustrují složitost vytváření objektivně „kvalitních" datasetů a to, jak technická rozhodnutí při filtrování mohou vést k nezamýšleným společenským odchylkám.

## Výsledky a výkonnost

V době publikace dosáhlo T5 nových rekordů výkonnosti (*state-of-the-art*) na řadě benchmarků, včetně **GLUE**, **SuperGLUE**, **SQuAD** a úloh sumarizace<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-google-blog-t5-2)</sup>. Model **T5-11B** dosáhl na benchmarku **SuperGLUE** výsledku blízkého lidské úrovni, čímž prokázal schopnost zvládat úlohy vyžadující složené logické uvažování<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-reddit-superglue-t5-9)</sup>. Tyto výsledky potvrdily ústřední hypotézu výzkumu: kombinace unifikovaného frameworku, velkého rozsahu a kvalitního datasetu je mimořádně účinnou strategií pro dosažení špičkových výsledků v NLP.

## Vývoj a varianty T5

Přístup T5 posloužil jako základ pro řadu následujících modelů:

- **mT5**: Vícejazyčná verze T5 trénovaná na korpusu **mC4** pokrývajícím **101 jazyků**<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Experimentální verze, která zcela upouští od tokenizace a pracuje přímo s **nezpracovanými bajty UTF-8**. To ji činí odolnou vůči překlepům a umožňuje zpracovávat jakýkoli jazyk „z krabice"<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Škálovatelná verze T5 zavádějící architekturu **Mixture-of-Experts (MoE)**, která umožnila zvýšit počet parametrů na biliony při zachování přiměřených výpočetních nákladů<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Nejde o novou architekturu, ale o standardní T5, která prošla dodatečnou fází dotrénování na stovkách úloh formulovaných ve formě instrukcí (*instruction tuning*). To výrazně zlepšilo její schopnost zobecňovat na nové, dosud neviděné úlohy v režimu **zero-shot** (bez příkladů)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Model rozvíjející myšlenky T5, který využívá nový předtréninkový cíl zvaný **Mixture of Denoisers**, kombinující různá schémata maskování textu pro zlepšení univerzálnosti<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_note-tay2022-ul2-14)</sup>.

## Odkazy

- Oficiální repozitář T5 na GitHubu
- Článek na blogu Google Research o výzkumu T5

## Literatura

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## Poznámky

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(CS)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
