---
title: "T5 (Text-to-Text Transfer Transformer) (HU)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(HU)"
language: "hu"
categories:
  - "Category:Google"
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7819
wiki_created_at: 2026-09-07T01:07:28Z
wiki_modified_at: 2026-09-07T01:07:28Z
downloaded_at: 2026-09-07T23:20:57Z
---

# T5 (Text-to-Text Transfer Transformer) (HU)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — a nagy nyelvi modellek egy családja, amelyet a Google AI kutatói fejlesztettek ki és 2019-ben mutattak be<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-raffel2020-1)</sup>. A T5 kulcsinnovációja az egységesített **„text-to-text"** keretrendszer, amely a természetes nyelvfeldolgozás (NLP) bármely feladatát egy szöveges szekvencia másikká való átalakításának problémájaként kezeli. Ez lehetővé tette egyetlen modell, veszteségfüggvény és tanítási eljárás alkalmazását feladatok széles körére, mint például a fordítás, összefoglalás, kérdés-válasz és osztályozás<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-google-blog-t5-2)</sup>.

A modell a transformer szabványos „enkóder-dekóder" architektúráján alapul, ami megkülönbözteti a csak enkóderből álló BERT-típusú és a csak dekóderből álló GPT-típusú modellektől. A T5 fejlesztését átfogó empirikus kutatásként tervezték, amelynek célja a transzfer tanulás különböző módszereinek szisztematikus vizsgálata és összehasonlítása volt az NLP területén, nem pedig alapvetően új módszer létrehozása<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-raffel2020-1)</sup>.

## A „Text-to-Text" paradigma

A T5 központi gondolata, hogy minden feladatot egységes formátumban fogalmaz meg. A modell szöveget kap bemenetként, és szöveget állít elő kimenetként. Annak érdekében, hogy a modell meg tudja különböztetni az eléje tárt feladatokat, a bemeneti szekvenciához egy speciális szöveges **prefixum-utasítás** adódik hozzá<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-google-blog-t5-2)</sup>.

- **Fordítás**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Hangulatelemzés (osztályozás)**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Összefoglalás**: \`summarize: \[hosszú cikk szövege\]\` → \`\[rövid összefoglaló\]\`

Ez a megközelítés gyökeresen leegyszerűsíti a modell alkalmazásának folyamatát, szükségtelenné téve az egyes feladatokhoz tartozó külön „fejek" (*task-specific heads*) kifejlesztését, ami a BERT-szerű architektúrákra volt jellemző<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-dhiwise-t5-3)</sup>.

## Architektúra és skálázás

### Enkóder-dekóder architektúra

A T5 a transformer szabványos architektúráját alkalmazza, amely két részből áll<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-raffel2020-1)</sup>:

- **Enkóder**: A teljes bemeneti szekvenciát egyszerre dolgozza fel, gazdag, kontextualizált reprezentációt hozva létre. A BERT-hez hasonlóan a T5 enkódere **kétirányú**.
- **Dekóder**: A kimeneti szöveget token-ről tokenre (autoregresszívan) állítja elő, az enkódertől kapott reprezentációt felhasználva.

Ez a hibrid struktúra lehetővé teszi a T5 számára, hogy hatékonyan kezelje mind a nyelvmegértési, mind a szöveggenerálási feladatokat<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-gfg-t5-4)</sup>.

### Főbb fejlesztések

A T5 architektúrája az eredeti transformer modellhez képest több módosítást tartalmaz:

- **Relatív pozicionális embedding-ek**: Az abszolút szinuszoid embedding-ek helyett a T5 a pozíciókódolás egy egyszerűsített, de hatékony relatív formáját alkalmazza, ahol az attention logitokhoz egy tanulható skaláris eltolás (bias) adódik hozzá, amely csak a tokenek közötti relatív távolságtól függ<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-raffel2020-1)</sup>.
- **Módosított rétegnormalizáció (Layer Norm)**: A normalizáció a reziduális kapcsolaton (*residual connection*) kívülre kerül, és az additív eltolást (bias) eltávolítják belőle a tanítási stabilitás növelése érdekében.

### A modell méretei

Az eredeti munkában a modellt több konfigurációban mutatták be, amelyek a paraméterek számában különböznek egymástól, lehetővé téve a skálázás hatásának szisztematikus vizsgálatát<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 millió paraméter
- **T5-Base**: ~220 millió paraméter
- **T5-Large**: ~770 millió paraméter
- **T5-3B**: ~3 milliárd paraméter
- **T5-11B**: ~11 milliárd paraméter

A kutatás megmutatta, hogy a modell méretének növelése az egyik legmegbízhatóbb módja a teljesítmény javításának<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-raffel2020-1)</sup>.

## Előtanítás: a C4 dataset és a Span Corruption feladat

### A Span Corruption feladat

A T5 előtanításához zajszűrési (*denoising*) feladatot választottak, mégpedig annak egy speciális változatát, amelyet **töredéksérítésnek (span corruption)** neveznek<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-t5-wikipedia-6)</sup>. A módszer a következőképpen működik:

1.  A bemeneti szövegben véletlenszerűen a tokenek 15%-a maszkolásra kerül.
2.  A BERT MLM módszerével ellentétben, ahol egyes tokeneket maszkolnak, a T5-ben teljes összefüggő töredékeket (*spans*) maszkolnak.
3.  Minden sérített töredéket egy egyedi maszk-tokennel helyettesítenek (például \`\<X\>\`, \`\<Y\>\`).
4.  A modell azt tanulja meg, hogy kimenetként az eltávolított töredékek sorozatát állítsa elő, amelyeket a megfelelő maszkok választanak el egymástól.

Ez a megközelítés arra kényszeríti a modellt, hogy teljes szövegszekvenciákat jósoljon meg, ami hatékonyabb előtanítási feladatnak bizonyult az egyszerű nyelvi modellezésnél<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-raffel2020-1)</sup>.

### A C4 dataset (Colossal Clean Crawled Corpus)

A transzfer tanulás potenciáljának kiaknázásához a kutatók egy hatalmas és minőségileg megtisztított szöveges adathalmazt hoztak létre, a **C4**-et, amelynek mérete körülbelül 750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-google-blog-t5-2)</sup>. Ezt a nyilvánosan elérhető **Common Crawl** webkorpusz nagyszabású megtisztításával és szűrésével állították elő<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-c4-dataset-pwc-7)</sup>. A tisztítási folyamat magában foglalta a duplikátumok, a sablonszövegek (,,Lorem ipsum"), a hiányos mondatok eltávolítását, valamint a trágár szókincs kiszűrését<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-dodge2021-doc-c4-8)</sup>.

### A C4 dataset kritikája

Annak ellenére, hogy a cél egy „tiszta" korpusz létrehozása volt, a C4 szűrési folyamata szisztematikus torzítások miatt kritikát kapott. Kutatások kimutatták, hogy a trágárságszűrő aránytalanul nagy mértékben távolított el LMBTQ+ közösségekhez kapcsolódó szövegeket, valamint az afroamerikai angol (AAE) nyelvváltozaton írt szövegeket<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-dodge2021-doc-c4-8)</sup>. Ezen kívül az adathalmazban jelentős mennyiségű sértő és szerzői joggal védett tartalmat fedeztek fel. Ezek a problémák jól illusztrálják az objektívan „minőségi" adathalmazok létrehozásának nehézségét, és azt, hogy a technikai szűrési döntések hogyan vezethetnek nem szándékolt társadalmi torzításokhoz.

## Eredmények és teljesítmény

A megjelenés idején a T5 új teljesítményrekordokat (*state-of-the-art*) állított fel számos benchmark-on, köztük a **GLUE**, **SuperGLUE**, **SQuAD** és összefoglalási feladatokon<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-google-blog-t5-2)</sup>. A **T5-11B** modell a **SuperGLUE**-n az emberi szinthez közeli eredményt ért el, bizonyítva, hogy képes összetett logikai következtetést igénylő feladatokat megoldani<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-reddit-superglue-t5-9)</sup>. Ezek az eredmények megerősítették a kutatás központi hipotézisét: az egységesített keretrendszer, a nagy méret és a minőségi adathalmaz kombinációja rendkívül hatékony stratégia az NLP-ben élvonalbeli eredmények elérésére.

## A T5 fejlődése és változatai

A T5 megközelítése számos későbbi modell alapjává vált:

- **mT5**: A T5 többnyelvű változata, amelyet a **101 nyelvet** lefedő **mC4** korpuszon tanítottak<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Egy kísérleti változat, amely teljesen lemond a tokenizálásról, és közvetlenül **nyers UTF-8 bájtokkal** dolgozik. Ez ellenállóvá teszi az elgépelésekkel szemben, és lehetővé teszi bármely nyelv „dobozból kivéve" való feldolgozását<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: A T5 skálázható változata, amely bevezette a **Mixture-of-Experts (MoE)** architektúrát, ami lehetővé tette a paraméterek számának billiónyira növelését, miközben az számítási költségek elfogadható szinten maradtak<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Ez nem új architektúra, hanem a szabványos T5, amely egy további finomhangolási (*fine-tuning*) fázison ment keresztül, ahol százával dolgoztak fel utasítások formájában megfogalmazott feladatokat (*instruction tuning*). Ez jelentősen javította a modell képességét az új, korábban nem látott feladatokra való általánosításra **zero-shot** módban (példák nélkül)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Egy T5 ötleteit továbbfejlesztő modell, amely egy **Mixture of Denoisers** nevű új előtanítási célfüggvényt alkalmaz, kombinálva a szövegmaszkolás különböző sémáit az általánosíthatóság javítása érdekében<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_note-tay2022-ul2-14)</sup>.

## Hivatkozások

- A T5 hivatalos GitHub-adattára
- A Google Research blogbejegyzése a T5 kutatásról

## Irodalom

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## Megjegyzések

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HU)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
