---
title: "T5 (Text-to-Text Transfer Transformer) (BG)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7809
wiki_created_at: 2026-09-07T01:07:19Z
wiki_modified_at: 2026-09-07T01:07:19Z
downloaded_at: 2026-09-07T23:20:53Z
---

# T5 (Text-to-Text Transfer Transformer) (BG)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — това е семейство от големи езикови модели, разработено от изследователи на Google AI и представено през 2019 година<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-raffel2020-1)</sup>. Ключовата иновация на T5 е унифицираният фреймворк **«text-to-text»**, който разглежда всяка задача по обработка на естествен език (NLP) като проблем за преобразуване на една текстова последователност в друга. Това позволи използването на единен модел, функция на загубата и процедура за обучение за широк спектър от задачи, като превод, суmaризация, отговори на въпроси и класификация<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-google-blog-t5-2)</sup>.

Моделът се основава на стандартната архитектура на трансформер „енкодер-декодер", което го отличава от модели от типа BERT (само енкодер) и GPT (само декодер). Работата върху T5 е замислена като мащабно емпирично изследване за систематично проучване и сравнение на различни методики за трансферно обучение в NLP, а не като създаване на принципно нов метод<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-raffel2020-1)</sup>.

## Парадигма „Text-to-Text"

Централната идея на T5 се състои в това, че всички задачи се формулират в единен формат. Моделът получава на входа текст и генерира на изхода също текст. За да може моделът да разграничава поставените пред него задачи, към входната последователност се добавя специален текстов **префикс-инструкция**<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-google-blog-t5-2)</sup>.

- **Превод**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **Класификация на тоналността**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **Суmaризация**: \`summarize: \[дълъг текст на статия\]\` → \`\[кратко изложение\]\`

Този подход радикално опростява процеса на прилагане на модела, като елиминира необходимостта от разработване на специфични „глави" (*task-specific heads*) за всяка отделна задача, което беше характерно за архитектури като BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-dhiwise-t5-3)</sup>.

## Архитектура и мащабиране

### Архитектура енкодер-декодер

T5 използва стандартна архитектура на трансформер, състояща се от две части<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-raffel2020-1)</sup>:

- **Енкодер**: Обработва цялата входна последователност едновременно, създавайки богато контекстуализирано представяне. Както при BERT, енкодерът на T5 е **двупосочен**.
- **Декодер**: Генерира изходния текст токен по токен (авторегресивно), използвайки представянето, получено от енкодера.

Тази хибридна структура позволява на T5 ефективно да решава както задачи за разбиране на езика, така и задачи за генериране на текст<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-gfg-t5-4)</sup>.

### Ключови усъвършенствания

Архитектурата на T5 включва няколко промени в сравнение с оригиналния трансформер:

- **Относителни позиционни embedding-и**: Вместо абсолютни синусоидални embedding-и, T5 използва опростена, но ефективна форма на относително позиционно кодиране, при която към логитите на вниманието се добавя обучаемо скаларно отместване (bias), зависещо само от относителното разстояние между токените<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-raffel2020-1)</sup>.
- **Модифицирана нормализация на слоевете (Layer Norm)**: Нормализацията е изнесена извън остатъчната връзка (*residual connection*) и от нея е премахнато адитивното отместване (bias) за повишаване на стабилността при обучение.

### Мащаби на модела

В оригиналната работа моделът е представен в няколко конфигурации, различаващи се по брой параметри, което позволи систематично да се изследва влиянието на мащаба<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 милиона параметра
- **T5-Base**: ~220 милиона параметра
- **T5-Large**: ~770 милиона параметра
- **T5-3B**: ~3 милиарда параметра
- **T5-11B**: ~11 милиарда параметра

Изследването показа, че увеличаването на мащаба на модела е един от най-надеждните начини за повишаване на неговата производителност<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-raffel2020-1)</sup>.

## Предварително обучение: датасет C4 и задачата Span Corruption

### Задачата Span Corruption

За предварително обучение на T5 е избрана задача за шумопотискане (*denoising*), а именно нейният специфичен вариант, наречен **повреждане на фрагменти (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-t5-wikipedia-6)</sup>. Методът работи по следния начин:

1.  Във входния текст случайно се маскират 15% от токените.
2.  За разлика от метода MLM в BERT, където се маскират отделни токени, в T5 се маскират цели непрекъснати фрагменти (*spans*).
3.  Всеки повреден фрагмент се заменя с един уникален токен-маска (например \`\<X\>\`, \`\<Y\>\`).
4.  Моделът се обучава да генерира на изхода последователност от изтритите фрагменти, разделени от съответните маски.

Този подход принуждава модела да предсказва цели текстови последователности, което се оказа по-ефективна задача за предварително обучение, отколкото простото езиково моделиране<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-raffel2020-1)</sup>.

### Датасет C4 (Colossal Clean Crawled Corpus)

За реализиране на потенциала на трансферното обучение изследователите създадоха огромен и качествено почистен набор от текстови данни **C4**, с обем около 750 ГБ<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-google-blog-t5-2)</sup>. Той е получен чрез мащабно почистване и филтриране на общодостъпния уеб корпус **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-c4-dataset-pwc-7)</sup>. Процесът на почистване включваше премахване на дубликати, шаблонен текст („Lorem ipsum"), непълни изречения, както и филтриране на нецензурна лексика<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-dodge2021-doc-c4-8)</sup>.

### Критика на датасета C4

Въпреки заявената цел за създаване на „чист" корпус, процесът на филтриране на C4 бе подложен на критика заради системни отклонения. Изследванията показаха, че филтърът за нецензурна лексика непропорционално премахваше текстове, свързани с ЛГБТК+ общности, а също и текстове на афроамерикански английски (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-dodge2021-doc-c4-8)</sup>. Освен това в датасета беше открито значително количество обидно и защитено с авторски права съдържание. Тези проблеми илюстрират сложността при създаването на обективно „качествени" набори от данни и начина, по който технически решения за филтриране могат да водят до непреднамерени социални отклонения.

## Резултати и производителност

Към момента на публикуване T5 постави нови рекорди на производителност (*state-of-the-art*) на множество benchmark-ове, включително **GLUE**, **SuperGLUE**, **SQuAD** и задачи за суmaризация<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-google-blog-t5-2)</sup>. По-специално, моделът **T5-11B** постигна на **SuperGLUE** резултат, близък до човешкото ниво, демонстрирайки способност да се справя със задачи, изискващи сложно логическо извеждане<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-reddit-superglue-t5-9)</sup>. Тези резултати потвърдиха централната хипотеза на изследването: комбинацията от унифициран фреймворк, голям мащаб и качествен набор от данни е изключително мощна стратегия за постигане на водещи резултати в NLP.

## Еволюция и варианти на T5

Подходът на T5 послужи като основа за множество следващи модели:

- **mT5**: Многоезична версия на T5, обучена на корпуса **mC4**, обхващащ **101 езика**<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: Експериментална версия, която напълно се отказва от токенизацията и работи директно със **сурови байтове UTF-8**. Това я прави устойчива на печатни грешки и позволява обработка на всеки език „от кутията"<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: Мащабируема версия на T5, въвела архитектурата **Mixture-of-Experts (MoE)**, което позволи увеличаване на броя на параметрите до трилиони при запазване на разумни изчислителни разходи<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: Това не е нова архитектура, а стандартен T5, преминал допълнителен етап на fine-tuning върху стотици задачи, формулирани под формата на инструкции (*instruction tuning*). Това значително повиши способността му за обобщение към нови, непознати задачи в режим **zero-shot** (без примери)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: Модел, развиващ идеите на T5, който използва нов предобучаващ обектив, наречен **Mixture of Denoisers**, комбинирайки различни схеми за маскиране на текст с цел подобряване на универсалността<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_note-tay2022-ul2-14)</sup>.

## Препратки

- Официално хранилище на T5 в GitHub
- Статия в блога на Google Research за изследването на T5

## Литература

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## Бележки

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(BG)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
