---
title: "T5 (Text-to-Text Transfer Transformer) (PL)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(PL)"
language: "pl"
categories:
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 7822
wiki_created_at: 2026-09-07T01:07:31Z
wiki_modified_at: 2026-09-07T01:07:31Z
downloaded_at: 2026-09-07T23:20:58Z
---

# T5 (Text-to-Text Transfer Transformer) (PL)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — to rodzina dużych modeli językowych opracowana przez badaczy Google AI i przedstawiona w 2019 roku<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-raffel2020-1)</sup>. Kluczową innowacją T5 jest ujednolicony framework **„text-to-text\\**, który traktuje każde zadanie przetwarzania języka naturalnego (NLP) jako problem przekształcenia jednej sekwencji tekstowej w drugą. Umożliwiło to zastosowanie jednego modelu, funkcji straty i procedury uczenia do szerokiego spektrum zadań, takich jak tłumaczenie, sumaryzacja, odpowiadanie na pytania i klasyfikacja<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-google-blog-t5-2)</sup>.

Model oparty jest na standardowej architekturze transformera „enkoder-dekoder", co odróżnia go od modeli typu BERT (wyłącznie enkoder) i GPT (wyłącznie dekoder). Praca nad T5 została pomyślana jako zakrojone na szeroką skalę empiryczne badanie służące systematycznemu poznaniu i porównaniu różnych metod transfer learningu w NLP, a nie jako stworzenie zasadniczo nowej metody<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-raffel2020-1)</sup>.

## Paradygmat „Text-to-Text\\

Centralna idea T5 polega na tym, że wszystkie zadania są formułowane w jednolitym formacie. Model otrzymuje na wejściu tekst i generuje na wyjściu również tekst. Aby model mógł rozróżniać postawione przed nim zadania, do sekwencji wejściowej dodawany jest specjalny tekstowy **prefiks-instrukcja**<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-google-blog-t5-2)</sup>.

- **Tłumaczenie**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Klasyfikacja wydźwięku**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Sumaryzacja**: \`summarize: \[długi tekst artykułu\]\` → \`\[streszczenie\]\`

Podejście to radykalnie upraszcza proces stosowania modelu, eliminując konieczność opracowywania specyficznych „głowic" (*task-specific heads*) dla każdego osobnego zadania, co było charakterystyczne dla architektur takich jak BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-dhiwise-t5-3)</sup>.

## Architektura i skalowanie

### Architektura enkoder-dekoder

T5 wykorzystuje standardową architekturę transformera składającą się z dwóch części<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-raffel2020-1)</sup>:

- **Enkoder**: Przetwarza całą sekwencję wejściową jednocześnie, tworząc bogate skontekstualizowane reprezentacje. Podobnie jak w BERT, enkoder T5 jest **dwukierunkowy**.
- **Dekoder**: Generuje tekst wyjściowy token po tokenie (autoregresywnie), wykorzystując reprezentację uzyskaną od enkodera.

Ta hybrydowa struktura pozwala T5 efektywnie rozwiązywać zarówno zadania rozumienia języka, jak i zadania generowania tekstu<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-gfg-t5-4)</sup>.

### Kluczowe ulepszenia

Architektura T5 zawiera kilka zmian w porównaniu z oryginalnym modelem transformera:

- **Relatywne pozycyjne embeddingi**: Zamiast absolutnych sinusoidalnych embeddingów T5 stosuje uproszczoną, lecz skuteczną formę relatywnego kodowania pozycji, gdzie do logitów uwagi dodawane jest uczące się skalarne przesunięcie (bias) zależne wyłącznie od względnej odległości między tokenami<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-raffel2020-1)</sup>.
- **Zmodyfikowana normalizacja warstw (Layer Norm)**: Normalizacja jest wyniesiona poza połączenie resztkowe (*residual connection*), a addytywne przesunięcie (bias) zostało z niej usunięte w celu poprawy stabilności uczenia.

### Rozmiary modelu

W oryginalnej pracy model został przedstawiony w kilku konfiguracjach różniących się liczbą parametrów, co pozwoliło systematycznie zbadać wpływ skali<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 milionów parametrów
- **T5-Base**: ~220 milionów parametrów
- **T5-Large**: ~770 milionów parametrów
- **T5-3B**: ~3 miliardy parametrów
- **T5-11B**: ~11 miliardów parametrów

Badanie wykazało, że zwiększanie skali modelu jest jednym z najbardziej niezawodnych sposobów poprawy jego wydajności<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-raffel2020-1)</sup>.

## Pretrening: dataset C4 i zadanie Span Corruption

### Zadanie Span Corruption

Do wstępnego uczenia T5 wybrano zadanie odszumiania (*denoising*), a konkretnie jego specyficzny wariant noszący nazwę **uszkadzania fragmentów (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-t5-wikipedia-6)</sup>. Metoda działa następująco:

1.  We wchodzącym tekście losowo maskowane jest 15% tokenów.
2.  W odróżnieniu od metody MLM w BERT, gdzie maskowane są pojedyncze tokeny, w T5 maskowane są całe ciągłe fragmenty (*spans*).
3.  Każdy uszkodzony fragment zastępowany jest jednym unikalnym tokenem-maską (np. \`\<X\>\`, \`\<Y\>\`).
4.  Model jest uczony generowania na wyjściu sekwencji usuniętych fragmentów oddzielonych odpowiednimi maskami.

Podejście to zmusza model do przewidywania całych sekwencji tekstu, co okazało się bardziej efektywnym zadaniem do pretreningu niż proste modelowanie językowe<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-raffel2020-1)</sup>.

### Dataset C4 (Colossal Clean Crawled Corpus)

Aby wykorzystać potencjał transfer learningu, badacze stworzyli ogromny i starannie oczyszczony zbiór danych tekstowych **C4** o objętości około 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-google-blog-t5-2)</sup>. Powstał on w wyniku zakrojonego na szeroką skalę czyszczenia i filtrowania publicznie dostępnego korpusu sieciowego **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-c4-dataset-pwc-7)</sup>. Proces czyszczenia obejmował usuwanie duplikatów, tekstu szablonowego („Lorem ipsum"), niekompletnych zdań, a także filtrowanie wulgaryzmów<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-dodge2021-doc-c4-8)</sup>.

### Krytyka datasetu C4

Pomimo deklarowanego celu stworzenia „czystego" korpusu, proces filtrowania C4 spotkał się z krytyką za systemowe uprzedzenia. Badania wykazały, że filtr wulgaryzmów nieproporcjonalnie usuwał teksty związane ze społecznościami LGBTQ+, a także teksty w afroamerykańskiej odmianie języka angielskiego (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-dodge2021-doc-c4-8)</sup>. Ponadto w datasecie wykryto znaczną ilość obraźliwych i chronionych prawem autorskim treści. Problemy te ilustrują trudność tworzenia obiektywnie „wysokiej jakości" zbiorów danych oraz to, w jaki sposób techniczne decyzje filtrujące mogą prowadzić do niezamierzonych uprzedzeń społecznych.

## Wyniki i wydajność

W chwili publikacji T5 ustanowiło nowe rekordy wydajności (*state-of-the-art*) na wielu benchmarkach, w tym **GLUE**, **SuperGLUE**, **SQuAD** i zadaniach sumaryzacji<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-google-blog-t5-2)</sup>. W szczególności model **T5-11B** osiągnął na **SuperGLUE** wynik zbliżony do poziomu ludzkiego, demonstrując zdolność do radzenia sobie z zadaniami wymagającymi złożonego wnioskowania logicznego<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-reddit-superglue-t5-9)</sup>. Wyniki te potwierdziły centralną hipotezę badania: kombinacja ujednoliconego frameworku, dużej skali i wysokiej jakości zbioru danych stanowi niezwykle skuteczną strategię osiągania czołowych wyników w NLP.

## Ewolucja i warianty T5

Podejście T5 stało się podstawą dla wielu kolejnych modeli:

- **mT5**: Wielojęzyczna wersja T5 wytrenowana na korpusie **mC4** obejmującym **101 języków**<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Eksperymentalna wersja, która całkowicie rezygnuje z tokenizacji i pracuje bezpośrednio na **surowych bajtach UTF-8**. Czyni ją to odporną na literówki i pozwala przetwarzać dowolny język „od razu po wyjęciu z pudełka"<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Skalowalna wersja T5, która wprowadziła architekturę **Mixture-of-Experts (MoE)**, co pozwoliło zwiększyć liczbę parametrów do bilionów przy zachowaniu rozsądnych kosztów obliczeniowych<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: To nie jest nowa architektura, lecz standardowy T5, który przeszedł dodatkowy etap fine-tuningu na setkach zadań sformułowanych w postaci instrukcji (*instruction tuning*). Znacząco poprawiło to jego zdolność do uogólniania na nowe, niewidziane wcześniej zadania w trybie **zero-shot** (bez przykładów)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Model rozwijający idee T5, który wykorzystuje nowy cel pretreningu o nazwie **Mixture of Denoisers**, łącząc różne schematy maskowania tekstu w celu poprawy uniwersalności<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_note-tay2022-ul2-14)</sup>.

## Odnośniki

- Oficjalne repozytorium T5 na GitHub
- Artykuł na blogu Google Research o badaniu T5

## Literatura

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## Przypisy

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(PL)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
