---
title: "T5 (Text-to-Text Transfer Transformer) (HE)"
source: "https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)"
wiki: "systems-analysis.info/int"
article: "T5_(Text-to-Text_Transfer_Transformer)_(HE)"
language: "he"
categories:
  - "Category:Google"
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7817
wiki_created_at: 2026-09-07T01:07:26Z
wiki_modified_at: 2026-09-07T01:07:26Z
downloaded_at: 2026-09-07T23:20:56Z
---

# T5 (Text-to-Text Transfer Transformer) (HE)

**T5** (**T**ext-to-**T**ext **T**ransfer **T**ransformer) — הוא משפחה של מודלי שפה גדולים שפותחה על ידי חוקרי Google AI והוצגה בשנת 2019<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-raffel2020-1)</sup>. החידוש המרכזי של T5 הוא מסגרת עבודה (framework) אחידה מסוג **«text-to-text»**, הרואה בכל משימת עיבוד שפה טבעית (NLP) בעיה של המרת רצף טקסט אחד לאחר. גישה זו אפשרה להשתמש במודל יחיד, בפונקציית הפסד יחידה ובנוהל אימון יחיד למגוון רחב של משימות, כגון תרגום, סיכום, מענה על שאלות וסיווג<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-google-blog-t5-2)</sup>.

המודל מבוסס על ארכיטקטורת transformer סטנדרטית מסוג «encoder-decoder», המבדילה אותו ממודלים כמו BERT (encoder בלבד) ו-GPT (decoder בלבד). העבודה על T5 נוצרה כמחקר אמפירי רחב היקף לצורך חקירה שיטתית והשוואה של שיטות שונות של למידת העברה (transfer learning) ב-NLP, ולא כיצירת שיטה חדשנית מהותית<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-raffel2020-1)</sup>.

## פרדיגמת «Text-to-Text»

הרעיון המרכזי של T5 הוא שכל המשימות מנוסחות בפורמט אחיד. המודל מקבל טקסט כקלט ומייצר טקסט כפלט. כדי שהמודל יוכל להבחין בין המשימות המוטלות עליו, מתווסף לרצף הקלט **קידומת-הוראה** טקסטואלית מיוחדת<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-google-blog-t5-2)</sup>.

- **תרגום**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **סיווג סנטימנט**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **סיכום**: \`summarize: \[טקסט מאמר ארוך\]\` → \`\[תקציר\]\`

גישה זו מפשטת באופן קיצוני את תהליך השימוש במודל, ומייתרת את הצורך בפיתוח «ראשים» ייעודיים (*task-specific heads*) עבור כל משימה בנפרד, כפי שאפיין ארכיטקטורות כמו BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-dhiwise-t5-3)</sup>.

## ארכיטקטורה וסקלאביליות

### ארכיטקטורת encoder-decoder

T5 משתמש בארכיטקטורת transformer סטנדרטית המורכבת משני חלקים<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-raffel2020-1)</sup>:

- **Encoder**: מעבד את רצף הקלט כולו בו-זמנית, ויוצר ייצוג עשיר ומקוטקסט. כמו ב-BERT, ה-encoder של T5 הוא **דו-כיווני**.
- **Decoder**: מייצר את טקסט הפלט token אחר token (בצורה אוטו-רגרסיבית), תוך שימוש בייצוג שהתקבל מה-encoder.

מבנה היברידי זה מאפשר ל-T5 לפתור ביעילות הן משימות של הבנת שפה והן משימות של יצירת טקסט<sup>[\[4\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-gfg-t5-4)</sup>.

### שיפורים מרכזיים

ארכיטקטורת T5 כוללת מספר שינויים ביחס למודל ה-transformer המקורי:

- **Relative positional embeddings**: במקום embeddings סינוסואידליים מוחלטים, T5 משתמש בצורה פשוטה אך יעילה של קידוד מיקום יחסי, שבה מתווסף לוגיט ה-attention הסחה (bias) ניתנת ללמידה, התלויה אך ורק במרחק היחסי בין tokens<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-raffel2020-1)</sup>.
- **נירמול שכבות (Layer Norm) מותאם**: הנירמול הוצא מחוץ לחיבור השיורי (*residual connection*), וממנו הוסרה ההסחה האדיטיבית (bias) לשם שיפור יציבות האימון.

### גדלי המודל

בעבודה המקורית הוצג המודל במספר תצורות הנבדלות בכמות הפרמטרים, מה שאפשר לחקור בשיטתיות את השפעת הסקאלה<sup>[\[5\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: ~60 מיליון פרמטרים
- **T5-Base**: ~220 מיליון פרמטרים
- **T5-Large**: ~770 מיליון פרמטרים
- **T5-3B**: ~3 מיליארד פרמטרים
- **T5-11B**: ~11 מיליארד פרמטרים

המחקר הראה כי הגדלת הסקאלה של המודל היא אחת הדרכים האמינות ביותר לשיפור הביצועים שלו<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-raffel2020-1)</sup>.

## אימון מקדים: dataset C4 ומשימת Span Corruption

### משימת Span Corruption

לאימון המקדים של T5 נבחרה משימת הפחתת רעש (*denoising*), ובמיוחד הגרסה הספציפית שלה הנקראת **פגיעה בקטעים (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-t5-wikipedia-6)</sup>. השיטה פועלת כך:

1.  ברצף הקלט, 15% מה-tokens מוסתרים באופן אקראי.
2.  בניגוד לשיטת MLM ב-BERT, שבה מוסתרים tokens בודדים, ב-T5 מוסתרים קטעים שלמים ורציפים (*spans*).
3.  כל קטע פגוע מוחלף ב-token מסכה ייחודי אחד (למשל, \`\<X\>\`, \`\<Y\>\`).
4.  המודל מאומן לייצר כפלט את רצף הקטעים שהוסרו, מופרדים על ידי המסכות המתאימות.

גישה זו מחייבת את המודל לחזות רצפי טקסט שלמים, וזה הוכח כמשימה יעילה יותר לאימון מקדים מאשר מידול שפה פשוט<sup>[\[1\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-raffel2020-1)</sup>.

### Dataset C4 (Colossal Clean Crawled Corpus)

כדי לממש את פוטנציאל למידת ההעברה, יצרו החוקרים מאגר נתוני טקסט עצום ומנוקה באיכות גבוהה בשם **C4**, בנפח של כ-750 GB<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-google-blog-t5-2)</sup>. הוא הופק באמצעות ניקוי וסינון נרחבים של קורפוס הרשת הזמין לציבור **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-c4-dataset-pwc-7)</sup>. תהליך הניקוי כלל הסרת כפילויות, טקסטים שבלוניים ("Lorem ipsum"), משפטים חלקיים, וכן סינון שפה פוגענית<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-dodge2021-doc-c4-8)</sup>.

### ביקורת על dataset C4

למרות המטרה המוצהרת של יצירת קורפוס «נקי», תהליך הסינון של C4 זכה לביקורת בשל הטיות שיטתיות. מחקרים הראו כי מסנן השפה הפוגענית הסיר באופן לא פרופורציונלי טקסטים הקשורים לקהילות LGBTQ+, כמו גם טקסטים באנגלית אמריקאית אפרו-אמריקאית (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-dodge2021-doc-c4-8)</sup>. בנוסף, במאגר הנתונים נמצא כמות ניכרת של תוכן פוגעני ומוגן בזכויות יוצרים. בעיות אלו ממחישות את מורכבות יצירת מאגרי נתונים «איכותיים» באופן אובייקטיבי, ואת האופן שבו החלטות טכניות על סינון עלולות להוביל להטיות חברתיות בלתי מכוונות.

## תוצאות וביצועים

במועד פרסומה, T5 קבעה שיאי ביצועים חדשים (*state-of-the-art*) על שלל benchmarks, כולל **GLUE**, **SuperGLUE**, **SQuAD** ומשימות סיכום<sup>[\[2\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-google-blog-t5-2)</sup>. בפרט, המודל **T5-11B** השיג ב-**SuperGLUE** תוצאה הקרובה לרמה האנושית, ובכך הדגים יכולת להתמודד עם משימות הדורשות היסק לוגי מורכב<sup>[\[9\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-reddit-superglue-t5-9)</sup>. תוצאות אלו אישרו את ההשערה המרכזית של המחקר: שילוב של framework אחיד, סקאלה גדולה ומאגר נתונים איכותי מהווה אסטרטגיה עוצמתית ביותר להשגת תוצאות מובילות ב-NLP.

## אבולוציה וגרסאות T5

גישת T5 שימשה בסיס למגוון מודלים עוקבים:

- **mT5**: גרסה רב-לשונית של T5, שאומנה על הקורפוס **mC4**, המכסה **101 שפות**<sup>[\[10\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: גרסה ניסיונית שמוותרת לחלוטין על tokenization ועובדת ישירות עם **בייטים גולמיים של UTF-8**. הדבר הופך אותה לעמידה בפני שגיאות כתיב ומאפשר לה לטפל בכל שפה «מהקופסה»<sup>[\[11\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: גרסה סקאלאבילית של T5, שהכניסה את ארכיטקטורת **Mixture-of-Experts (MoE)**, מה שאפשר להגדיל את מספר הפרמטרים לטריליונים תוך שמירה על עלויות חישוב סבירות<sup>[\[12\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: זו אינה ארכיטקטורה חדשה, אלא T5 סטנדרטי שעבר שלב נוסף של fine-tuning על מאות משימות שנוסחו כהוראות (*instruction tuning*). הדבר שיפר משמעותית את יכולתו להכללה על משימות חדשות שלא ראה קודם, במצב **zero-shot** (ללא דוגמאות)<sup>[\[13\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-chung2022-flan-13)</sup>.
- **UL2**: מודל המפתח את רעיונות T5, המשתמש ב-objective אימון מקדים חדש בשם **Mixture of Denoisers**, המשלב תוכניות מיסוך טקסט שונות לשיפור האוניברסאליות<sup>[\[14\]](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_note-tay2022-ul2-14)</sup>.

## קישורים חיצוניים

- מאגר T5 הרשמי ב-GitHub
- מאמר בבלוג Google Research על מחקר T5

## ספרות

- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. arXiv:2010.11934.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. arXiv:2104.08758.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. arXiv:2108.08877.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. arXiv:2112.07916.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. arXiv:2105.13626.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. arXiv:2205.05131.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. arXiv:2210.11416.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. arXiv:2301.13688.

## הערות

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[6]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[7]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[8]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[9]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[10]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[11]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[12]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[13]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_(Text-to-Text_Transfer_Transformer)_(HE)#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[14]</a></span>
