---
title: "T5 (Text-to-Text Transfer Transformer) (NL)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7821
wiki_created_at: 2026-09-07T01:07:30Z
wiki_modified_at: 2026-09-07T01:07:30Z
downloaded_at: 2026-09-07T23:20:58Z
---

# T5 (Text-to-Text Transfer Transformer) (NL)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — is een familie van grote taalmodellen, ontwikkeld door onderzoekers van Google AI en geïntroduceerd in 2019<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-raffel2020-1)</sup>. De centrale innovatie van T5 is een uniform **«text-to-text»**-raamwerk dat elke taak op het gebied van natuurlijke taalverwerking (NLP) beschouwt als een probleem van het omzetten van de ene tekstreeks naar de andere. Dit maakte het mogelijk één enkel model, één verliesfunctie en één trainingsprocedure te gebruiken voor een breed spectrum aan taken, zoals vertaling, samenvatting, het beantwoorden van vragen en classificatie<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-google-blog-t5-2)</sup>.

Het model is gebaseerd op de standaard encoder-decoder transformer-architectuur, wat het onderscheidt van modellen als BERT (alleen encoder) en GPT (alleen decoder). Het werk aan T5 was opgezet als grootschalig empirisch onderzoek voor het systematisch bestuderen en vergelijken van verschillende methoden voor transfer learning in NLP, en niet als de ontwikkeling van een principieel nieuwe methode<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-raffel2020-1)</sup>.

## Paradigma «Text-to-Text»

Het centrale idee van T5 is dat alle taken worden geformuleerd in een uniform formaat. Het model ontvangt tekst als invoer en genereert tekst als uitvoer. Om het model in staat te stellen de hem voorgelegde taken te onderscheiden, wordt aan de invoerreeks een speciaal tekstueel **instructieprefix** toegevoegd<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-google-blog-t5-2)</sup>.

- **Vertaling**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Sentimentclassificatie**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Samenvatting**: \`summarize: \[lange artikeltekst\]\` → \`\[korte samenvatting\]\`

Deze aanpak vereenvoudigt het gebruik van het model radicaal door de noodzaak te elimineren taakspecifieke «koppen» (*task-specific heads*) te ontwikkelen voor elke afzonderlijke taak, wat kenmerkend was voor architecturen als BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-dhiwise-t5-3)</sup>.

## Architectuur en schaalbaarheid

### Encoder-decoder-architectuur

T5 maakt gebruik van de standaard transformer-architectuur, die bestaat uit twee onderdelen<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-raffel2020-1)</sup>:

- **Encoder**: Verwerkt de volledige invoerreeks tegelijkertijd en creëert een rijke gecontextualiseerde representatie. Net als in BERT is de encoder van T5 **bidirectioneel**.
- **Decoder**: Genereert de uitvoertekst token voor token (autoregressief), gebruikmakend van de representatie die van de encoder is ontvangen.

Deze hybride structuur stelt T5 in staat zowel taalbegrip- als tekstgeneratietaken effectief op te lossen<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-gfg-t5-4)</sup>.

### Belangrijkste verbeteringen

De architectuur van T5 bevat een aantal wijzigingen ten opzichte van het oorspronkelijke transformer-model:

- **Relatieve positionele embeddings**: In plaats van absolute sinusoïdale embeddings gebruikt T5 een vereenvoudigde maar effectieve vorm van relatieve positiecodering, waarbij een trainbare scalaire bias die uitsluitend afhankelijk is van de relatieve afstand tussen tokens, wordt opgeteld bij de aandacht-logits<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-raffel2020-1)</sup>.
- **Aangepaste laagnormalisatie (Layer Norm)**: De normalisatie is buiten de residuele verbinding (*residual connection*) geplaatst en de additieve verschuiving (bias) is verwijderd om de trainingsstabiliteit te verbeteren.

### Modelomvang

In het oorspronkelijke werk werd het model gepresenteerd in meerdere configuraties die verschillen in het aantal parameters, waardoor de invloed van schaal systematisch kon worden bestudeerd<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 miljoen parameters
- **T5-Base**: ~220 miljoen parameters
- **T5-Large**: ~770 miljoen parameters
- **T5-3B**: ~3 miljard parameters
- **T5-11B**: ~11 miljard parameters

Het onderzoek toonde aan dat het vergroten van de modelomvang een van de betrouwbaarste manieren is om de prestaties te verbeteren<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-raffel2020-1)</sup>.

## Vooraf trainen: dataset C4 en de taak Span Corruption

### De taak Span Corruption

Voor het vooraf trainen van T5 werd gekozen voor een ruisonderdrukkingstaak (*denoising*), namelijk een specifieke variant daarvan genaamd **fragmentbeschadiging (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-t5-wikipedia-6)</sup>. De methode werkt als volgt:

1.  In de invoertekst wordt willekeurig 15% van de tokens gemaskeerd.
2.  In tegenstelling tot de MLM-methode in BERT, waarbij afzonderlijke tokens worden gemaskeerd, worden in T5 volledige aaneengesloten fragmenten (*spans*) gemaskeerd.
3.  Elk beschadigd fragment wordt vervangen door één uniek maskertoken (bijvoorbeeld \`\<X\>\`, \`\<Y\>\`).
4.  Het model wordt getraind om als uitvoer de reeks verwijderde fragmenten te genereren, gescheiden door de bijbehorende maskers.

Deze aanpak dwingt het model volledige tekstreeksen te voorspellen, wat een effectievere voortrainingstaak bleek te zijn dan gewone taalmodellering<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-raffel2020-1)</sup>.

### Dataset C4 (Colossal Clean Crawled Corpus)

Om het potentieel van transfer learning te benutten, creëerden de onderzoekers een enorme en grondig gereinigde verzameling tekstgegevens, **C4**, met een omvang van ongeveer 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-google-blog-t5-2)</sup>. Deze werd verkregen door grootschalige reiniging en filtering van het openbaar beschikbare webcorpus **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-c4-dataset-pwc-7)</sup>. Het reinigingsproces omvatte het verwijderen van duplicaten, sjabloontekst ("Lorem ipsum"), onvolledige zinnen en het filteren van ongepaste taal<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-dodge2021-doc-c4-8)</sup>.

### Kritiek op dataset C4

Ondanks het verklaarde doel een «schoon» corpus te creëren, werd het filterproces van C4 bekritiseerd vanwege systematische vertekeningen. Onderzoek toonde aan dat het filter voor ongepaste taal onevenredig veel teksten verwijderde die verband houden met LGBTQ+-gemeenschappen, evenals teksten in het Afro-Amerikaans Engels (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-dodge2021-doc-c4-8)</sup>. Bovendien werd in de dataset een aanzienlijke hoeveelheid aanstootgevende en auteursrechtelijk beschermde inhoud aangetroffen. Deze problemen illustreren de complexiteit van het samenstellen van objectief «kwalitatieve» datasets en hoe technische filterbeslissingen kunnen leiden tot onbedoelde maatschappelijke vertekeningen.

## Resultaten en prestaties

Ten tijde van de publicatie vestigde T5 nieuwe prestatierecords (*state-of-the-art*) op tal van benchmarks, waaronder **GLUE**, **SuperGLUE**, **SQuAD** en samenvattingstaken<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-google-blog-t5-2)</sup>. In het bijzonder behaalde het model **T5-11B** op **SuperGLUE** een resultaat dicht bij menselijk niveau, waarmee het aantoonde in staat te zijn taken aan te pakken die complexe redenering vereisen<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-reddit-superglue-t5-9)</sup>. Deze resultaten bevestigden de centrale hypothese van het onderzoek: de combinatie van een uniform raamwerk, grote schaal en een kwalitatieve dataset is een buitengewoon krachtige strategie om vooruitstrevende resultaten in NLP te behalen.

## Evolutie en varianten van T5

De T5-aanpak diende als basis voor tal van latere modellen:

- **mT5**: Een meertalige versie van T5, getraind op het corpus **mC4**, dat **101 talen** omvat<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Een experimentele versie die tokenisatie volledig achterwege laat en rechtstreeks werkt met **ruwe UTF-8-bytes**. Dit maakt het robuust tegen typefouten en stelt het in staat elke taal «out of the box» te verwerken<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Een schaalbare versie van T5 die de **Mixture-of-Experts (MoE)**-architectuur introduceerde, waardoor het aantal parameters kon worden opgeschaald tot biljoenen met behoud van redelijke rekenkosten<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Dit is geen nieuwe architectuur, maar de standaard T5 die een extra fase van fine-tuning heeft ondergaan op honderden taken geformuleerd als instructies (*instruction tuning*). Dit heeft het vermogen tot generalisatie naar nieuwe, nog niet eerder geziene taken in de **zero-shot**-modus (zonder voorbeelden) aanzienlijk verbeterd<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Een model dat voortbouwt op de ideeën van T5 en gebruikmaakt van een nieuwe voortrainingsdoelstelling genaamd **Mixture of Denoisers**, waarbij verschillende maskeringsschema's worden gecombineerd om de universele toepasbaarheid te verbeteren<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_note-tay2022-ul2-14)</sup>.

## Verwijzingen

- Officiële T5-repository op GitHub
- Blogpost van Google Research over het T5-onderzoek

## Literatuur

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## Noten

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(NL)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
