---
title: "T5 (Text-to-Text Transfer Transformer) (PT)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(PT)"
language: "pt"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Portuguese"
revision_id: 7823
wiki_created_at: 2026-09-07T01:07:32Z
wiki_modified_at: 2026-09-07T01:07:32Z
downloaded_at: 2026-09-07T23:20:59Z
---

# T5 (Text-to-Text Transfer Transformer) (PT)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) é uma família de grandes modelos de linguagem, desenvolvida por pesquisadores do Google AI e apresentada em 2019<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-raffel2020-1)</sup>. A inovação principal do T5 é um framework unificado **"text-to-text"**, que trata qualquer tarefa de processamento de linguagem natural (PLN) como um problema de transformar uma sequência de texto em outra. Isso permitiu o uso de um único modelo, função de perda e procedimento de treinamento para uma ampla gama de tarefas, como tradução, sumarização, resposta a perguntas e classificação<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-google-blog-t5-2)</sup>.

O modelo é baseado na arquitetura transformer padrão "encoder-decoder", o que o diferencia de modelos como o BERT (apenas encoder) e o GPT (apenas decoder). O trabalho no T5 foi concebido como um estudo empírico em larga escala para explorar e comparar sistematicamente várias técnicas de aprendizado por transferência em PLN, em vez da criação de um método fundamentalmente novo<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-raffel2020-1)</sup>.

## Paradigma "Text-to-Text"

A ideia central do T5 é que todas as tarefas são formuladas em um formato unificado. O modelo recebe um texto como entrada e também gera um texto como saída. Para que o modelo possa distinguir as tarefas que lhe são atribuídas, um **prefixo de instrução** textual especial é adicionado à sequência de entrada<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-google-blog-t5-2)</sup>.

- **Tradução**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Classificação de sentimento**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Sumarização**: \`summarize: \[longo texto do artigo\]\` → \`\[breve resumo\]\`

Essa abordagem simplifica radicalmente o processo de aplicação do modelo, eliminando a necessidade de desenvolver "cabeças" específicas para cada tarefa (*task-specific heads*), o que era característico de arquiteturas como o BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-dhiwise-t5-3)</sup>.

## Arquitetura e Escala

### Arquitetura Encoder-Decoder

O T5 utiliza uma arquitetura transformer padrão, composta por duas partes<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-raffel2020-1)</sup>:

- **Encoder**: Processa toda a sequência de entrada simultaneamente, criando uma representação rica e contextualizada. Assim como no BERT, o encoder do T5 é **bidirecional**.
- **Decoder**: Gera o texto de saída token por token (de forma autorregressiva), utilizando a representação obtida do encoder.

Essa estrutura híbrida permite que o T5 resolva eficientemente tanto tarefas de compreensão de linguagem quanto tarefas de geração de texto<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-gfg-t5-4)</sup>.

### Principais Melhorias

A arquitetura T5 inclui várias modificações em comparação com o modelo transformer original:

- **Embeddings posicionais relativos**: Em vez de embeddings sinusoidais absolutos, o T5 utiliza uma forma simplificada, mas eficaz, de codificação de posição relativa, onde um deslocamento escalar treinável (bias) é adicionado aos logits de atenção, dependendo apenas da distância relativa entre os tokens<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-raffel2020-1)</sup>.
- **Normalização de camada (Layer Norm) modificada**: A normalização é movida para fora da conexão residual (*residual connection*), e o deslocamento aditivo (bias) é removido para aumentar a estabilidade do treinamento.

### Escalas do Modelo

No trabalho original, o modelo foi apresentado em várias configurações, diferenciadas pelo número de parâmetros, o que permitiu um estudo sistemático do impacto da escala<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 milhões de parâmetros
- **T5-Base**: ~220 milhões de parâmetros
- **T5-Large**: ~770 milhões de parâmetros
- **T5-3B**: ~3 bilhões de parâmetros
- **T5-11B**: ~11 bilhões de parâmetros

O estudo mostrou que aumentar a escala do modelo é uma das formas mais confiáveis de melhorar seu desempenho<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-raffel2020-1)</sup>.

## Pré-treinamento: Dataset C4 e a Tarefa de Span Corruption

### Tarefa de Span Corruption

Para o pré-treinamento do T5, foi escolhida uma tarefa de remoção de ruído (*denoising*), especificamente uma variante chamada **corrupção de trechos (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-t5-wikipedia-6)</sup>. O método funciona da seguinte forma:

1.  No texto de entrada, 15% dos tokens são mascarados aleatoriamente.
2.  Diferente do método MLM no BERT, onde tokens individuais são mascarados, no T5, trechos contínuos inteiros (*spans*) são mascarados.
3.  Cada trecho corrompido é substituído por um token de máscara único (por exemplo, \`\<X\>\`, \`\<Y\>\`).
4.  O modelo é treinado para gerar na saída a sequência dos trechos removidos, separados pelas máscaras correspondentes.

Essa abordagem força o modelo a prever sequências inteiras de texto, o que se revelou uma tarefa de pré-treinamento mais eficaz do que a simples modelagem de linguagem<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-raffel2020-1)</sup>.

### Dataset C4 (Colossal Clean Crawled Corpus)

Para realizar o potencial do aprendizado por transferência, os pesquisadores criaram um conjunto de dados de texto enorme e de alta qualidade chamado **C4**, com cerca de 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-google-blog-t5-2)</sup>. Ele foi obtido a partir da limpeza e filtragem em larga escala do corpus da web publicamente disponível **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-c4-dataset-pwc-7)</sup>. O processo de limpeza incluiu a remoção de duplicatas, texto de modelo ("Lorem ipsum"), sentenças incompletas, bem como a filtragem de linguagem imprópria<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-dodge2021-doc-c4-8)</sup>.

### Críticas ao Dataset C4

Apesar do objetivo declarado de criar um corpus "limpo", o processo de filtragem do C4 foi criticado por vieses sistêmicos. Estudos mostraram que o filtro de linguagem imprópria removeu desproporcionalmente textos relacionados a comunidades LGBTQ+, bem como textos em inglês afro-americano (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-dodge2021-doc-c4-8)</sup>. Além disso, foi encontrada no dataset uma quantidade significativa de conteúdo ofensivo e protegido por direitos autorais. Esses problemas ilustram a complexidade de criar conjuntos de dados objetivamente de "qualidade" e como as decisões técnicas de filtragem podem levar a vieses sociais não intencionais.

## Resultados e Desempenho

Na época de sua publicação, o T5 estabeleceu novos recordes de desempenho (*state-of-the-art*) em vários benchmarks, incluindo **GLUE**, **SuperGLUE**, **SQuAD** e tarefas de sumarização<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-google-blog-t5-2)</sup>. Em particular, o modelo **T5-11B** alcançou no **SuperGLUE** um resultado próximo ao nível humano, demonstrando a capacidade de lidar com tarefas que exigem raciocínio lógico complexo<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-reddit-superglue-t5-9)</sup>. Esses resultados confirmaram a hipótese central da pesquisa: a combinação de um framework unificado, grande escala e um conjunto de dados de alta qualidade é uma estratégia extremamente poderosa para alcançar resultados de ponta em PLN.

## Evolução e Variantes do T5

A abordagem do T5 serviu como base para muitos modelos subsequentes:

- **mT5**: Uma versão multilíngue do T5, treinada no corpus **mC4**, que abrange **101 idiomas**<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Uma versão experimental que abandona completamente a tokenização e opera diretamente com **bytes brutos UTF-8**. Isso a torna robusta a erros de digitação e permite processar qualquer idioma "out-of-the-box"<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Uma versão escalável do T5 que introduziu a arquitetura **Mixture-of-Experts (MoE)**, permitindo aumentar o número de parâmetros para trilhões, mantendo custos computacionais razoáveis<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Não é uma nova arquitetura, mas um T5 padrão que passou por uma etapa adicional de ajuste fino em centenas de tarefas formuladas como instruções (*instruction tuning*). Isso aumentou significativamente sua capacidade de generalizar para tarefas novas e inéditas no modo **zero-shot** (sem exemplos)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Um modelo que desenvolve as ideias do T5, utilizando um novo objetivo de pré-treinamento chamado **Mixture of Denoisers**, combinando diferentes esquemas de mascaramento de texto para melhorar a universalidade<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_note-tay2022-ul2-14)</sup>.

## Ligações externas

- <a href="https://github.com/google-research/text-to-text-transfer-transformer" class="external text" rel="nofollow">Repositório oficial do T5 no GitHub</a>
- <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external text" rel="nofollow">Artigo no blog do Google Research sobre a pesquisa do T5</a>

## Literatura

- Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. <a href="https://arxiv.org/abs/2010.11934" class="external text" rel="nofollow">arXiv:2010.11934</a>.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. <a href="https://arxiv.org/abs/2104.08758" class="external text" rel="nofollow">arXiv:2104.08758</a>.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. <a href="https://arxiv.org/abs/2108.08877" class="external text" rel="nofollow">arXiv:2108.08877</a>.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. <a href="https://arxiv.org/abs/2112.07916" class="external text" rel="nofollow">arXiv:2112.07916</a>.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. <a href="https://arxiv.org/abs/2205.05131" class="external text" rel="nofollow">arXiv:2205.05131</a>.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. <a href="https://arxiv.org/abs/2210.11416" class="external text" rel="nofollow">arXiv:2210.11416</a>.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. <a href="https://arxiv.org/abs/2301.13688" class="external text" rel="nofollow">arXiv:2301.13688</a>.

## Notas

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PT)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
