---
title: "T5 - T5"
source: "https://systems-analysis.info/int/T5_-_T5"
wiki: "systems-analysis.info/int"
article: "T5_-_T5"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Google"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 7833
wiki_created_at: 2026-09-07T01:07:40Z
wiki_modified_at: 2026-09-07T01:07:40Z
downloaded_at: 2026-09-07T23:21:03Z
---

# T5 - T5

**T5** (اختصار لـ **T**ext-to-**T**ext **T**ransfer **T**ransformer) هي عائلة من نماذج اللغة الكبيرة التي طورها باحثو Google AI وقُدمت في عام 2019<sup>[\[1\]](https://systems-analysis.info/int/T5_-_T5#cite_note-raffel2020-1)</sup>. الابتكار الرئيسي في T5 هو إطار العمل الموحد **«نص-إلى-نص»** (text-to-text)، الذي يتعامل مع أي مهمة في معالجة اللغات الطبيعية (NLP) كمشكلة تحويل سلسلة نصية إلى أخرى. وقد سمح ذلك باستخدام نموذج واحد، ودالة خسارة واحدة، وإجراء تدريب واحد لمجموعة واسعة من المهام، مثل الترجمة، والتلخيص، والإجابة على الأسئلة، والتصنيف<sup>[\[2\]](https://systems-analysis.info/int/T5_-_T5#cite_note-google-blog-t5-2)</sup>.

يعتمد النموذج على بنية المحول القياسية «المُشفِّر-المُفكِّك»، مما يميزه عن نماذج مثل BERT (المُشفِّر فقط) و GPT (المُفكِّك فقط). لقد صُمم العمل على T5 كدراسة تجريبية واسعة النطاق لدراسة ومقارنة منهجيات التعلم بالنقل المختلفة في معالجة اللغات الطبيعية بشكل منهجي، وليس كابتكار طريقة جديدة جوهريًا<sup>[\[1\]](https://systems-analysis.info/int/T5_-_T5#cite_note-raffel2020-1)</sup>.

## Text-to-Text paradigm - إطار عمل «نص-إلى-نص»

الفكرة المركزية في T5 هي أن جميع المهام تُصاغ في شكل موحد. يتلقى النموذج نصًا كمدخل ويُنشئ نصًا كمخرج. ولكي يتمكن النموذج من التمييز بين المهام الموكلة إليه، تُضاف **بادئة نصية إرشادية** خاصة إلى تسلسل الإدخال<sup>[\[2\]](https://systems-analysis.info/int/T5_-_T5#cite_note-google-blog-t5-2)</sup>.

- **الترجمة**: \`translate English to German: That is good.\` → \`Das ist gut.\`
- **تصنيف المشاعر**: \`sst2 sentence: a very exciting film.\` → \`positive\`
- **التلخيص**: \`summarize: \[نص مقال طويل\]\` → \`\[ملخص موجز\]\`

يبسط هذا النهج بشكل جذري عملية تطبيق النموذج، مما يلغي الحاجة إلى تطوير «رؤوس» خاصة بالمهام (*task-specific heads*) لكل مهمة على حدة، وهو ما كان شائعًا في البنى الهندسية مثل BERT<sup>[\[3\]](https://systems-analysis.info/int/T5_-_T5#cite_note-dhiwise-t5-3)</sup>.

## البنية والتوسع

### بنية المُشفِّر-المُفكِّك

يستخدم T5 بنية المحول القياسية، التي تتكون من جزأين<sup>[\[1\]](https://systems-analysis.info/int/T5_-_T5#cite_note-raffel2020-1)</sup>:

- **المُشفِّر (Encoder)**: يعالج تسلسل الإدخال بأكمله في وقت واحد، مما يُنشئ تمثيلًا غنيًا بالسياق. وكما هو الحال في BERT، فإن مُشفِّر T5 **ثنائي الاتجاه**.
- **المُفكِّك (Decoder)**: يُنشئ النص الناتج رمزًا تلو الآخر (بشكل ذاتي الانحدار)، مستخدمًا التمثيل الذي تم الحصول عليه من المُشفِّر.

تسمح هذه البنية الهجينة لـ T5 بحل مهام فهم اللغة ومهام توليد النصوص بفعالية<sup>[\[4\]](https://systems-analysis.info/int/T5_-_T5#cite_note-gfg-t5-4)</sup>.

### التحسينات الرئيسية

تتضمن بنية T5 عدة تغييرات مقارنة بنموذج المحول الأصلي:

- **التضمينات الموضعية النسبية**: بدلاً من التضمينات الجيبية المطلقة، يستخدم T5 شكلاً مبسطًا ولكنه فعال من الترميز الموضعي النسبي، حيث يُضاف إلى لوجيتات الانتباه انحياز قياسي قابل للتعلم (bias) يعتمد فقط على المسافة النسبية بين الرموز<sup>[\[1\]](https://systems-analysis.info/int/T5_-_T5#cite_note-raffel2020-1)</sup>.
- **تسوية الطبقات المعدلة (Layer Norm)**: تم نقل التسوية إلى خارج الاتصال المتبقي (*residual connection*)، وأُزيل منها الانحياز الجمعي (bias) لزيادة استقرار التدريب.

### أحجام النموذج

في الورقة البحثية الأصلية، قُدم النموذج في عدة تكوينات تختلف في عدد المعلمات، مما سمح بدراسة تأثير الحجم بشكل منهجي<sup>[\[5\]](https://systems-analysis.info/int/T5_-_T5#cite_note-huggingface-t5-doc-5)</sup>:

- **T5-Small**: حوالي 60 مليون معلمة
- **T5-Base**: حوالي 220 مليون معلمة
- **T5-Large**: حوالي 770 مليون معلمة
- **T5-3B**: حوالي 3 مليارات معلمة
- **T5-11B**: حوالي 11 مليار معلمة

أظهرت الدراسة أن زيادة حجم النموذج هي إحدى أكثر الطرق موثوقية لتعزيز أدائه<sup>[\[1\]](https://systems-analysis.info/int/T5_-_T5#cite_note-raffel2020-1)</sup>.

## التدريب المسبق: مجموعة بيانات C4 ومهمة إفساد الامتداد

### مهمة إفساد الامتداد (Span Corruption)

للتدريب المسبق لـ T5، تم اختيار مهمة إزالة التشويش (*denoising*)، وتحديدًا متغيرها المسمى **إفساد الامتداد (span corruption)**<sup>[\[6\]](https://systems-analysis.info/int/T5_-_T5#cite_note-t5-wikipedia-6)</sup>. تعمل الطريقة على النحو التالي:

1.  في النص المدخل، يتم إخفاء 15% من الرموز بشكل عشوائي.
2.  على عكس طريقة MLM في BERT، حيث يتم إخفاء رموز فردية، في T5 يتم إخفاء امتدادات (*spans*) متصلة كاملة.
3.  يُستبدل كل امتداد تالف برمز قناع فريد واحد (على سبيل المثال، \`\<X\>\`، \`\<Y\>\`).
4.  يُدرب النموذج على توليد تسلسل من الامتدادات المحذوفة في المخرجات، مفصولة بالأقنعة المقابلة لها.

يجبر هذا النهج النموذج على التنبؤ بتسلسلات كاملة من النص، وهو ما أثبت أنه مهمة أكثر فعالية للتدريب المسبق من مجرد نمذجة اللغة<sup>[\[1\]](https://systems-analysis.info/int/T5_-_T5#cite_note-raffel2020-1)</sup>.

### مجموعة بيانات C4 (Colossal Clean Crawled Corpus)

لتحقيق إمكانات التعلم بالنقل، أنشأ الباحثون مجموعة بيانات نصية ضخمة ونظيفة الجودة تسمى **C4**، بحجم حوالي 750 جيجابايت<sup>[\[2\]](https://systems-analysis.info/int/T5_-_T5#cite_note-google-blog-t5-2)</sup>. تم الحصول عليها من خلال عملية تنظيف وتصفية واسعة النطاق لمستودع الويب المتاح للجمهور **Common Crawl**<sup>[\[7\]](https://systems-analysis.info/int/T5_-_T5#cite_note-c4-dataset-pwc-7)</sup>. تضمنت عملية التنظيف إزالة التكرارات، والنصوص النموذجية ("Lorem ipsum")، والجمل غير المكتملة، بالإضافة إلى تصفية المفردات البذيئة<sup>[\[8\]](https://systems-analysis.info/int/T5_-_T5#cite_note-dodge2021-doc-c4-8)</sup>.

### الانتقادات الموجهة لمجموعة بيانات C4

على الرغم من الهدف المعلن لإنشاء مجموعة بيانات «نظيفة»، تعرضت عملية تصفية C4 لانتقادات بسبب الانحيازات المنهجية. أظهرت الأبحاث أن مرشح المفردات البذيئة أزال بشكل غير متناسب النصوص المتعلقة بمجتمعات LGBTQ+، بالإضافة إلى النصوص باللغة الإنجليزية الأمريكية من أصل أفريقي (AAE)<sup>[\[8\]](https://systems-analysis.info/int/T5_-_T5#cite_note-dodge2021-doc-c4-8)</sup>. علاوة على ذلك، تم اكتشاف كمية كبيرة من المحتوى المسيء والمحمي بحقوق الطبع والنشر في مجموعة البيانات. توضح هذه المشكلات مدى صعوبة إنشاء مجموعات بيانات «عالية الجودة» بشكل موضوعي وكيف يمكن أن تؤدي القرارات التقنية المتعلقة بالتصفية إلى انحيازات اجتماعية غير مقصودة.

## النتائج والأداء

في وقت نشره، سجل T5 أرقامًا قياسية جديدة في الأداء (*state-of-the-art*) في العديد من معايير الأداء، بما في ذلك **GLUE**، و**SuperGLUE**، و**SQuAD**، ومهام التلخيص<sup>[\[2\]](https://systems-analysis.info/int/T5_-_T5#cite_note-google-blog-t5-2)</sup>. على وجه الخصوص، حقق نموذج **T5-11B** على **SuperGLUE** نتيجة قريبة من مستوى الأداء البشري، مما أظهر قدرته على التعامل مع المهام التي تتطلب استدلالًا منطقيًا معقدًا<sup>[\[9\]](https://systems-analysis.info/int/T5_-_T5#cite_note-reddit-superglue-t5-9)</sup>. أكدت هذه النتائج الفرضية المركزية للدراسة: أن الجمع بين إطار عمل موحد، وحجم كبير، ومجموعة بيانات عالية الجودة يمثل استراتيجية قوية للغاية لتحقيق نتائج متقدمة في معالجة اللغات الطبيعية.

## التطور ومتغيرات T5

كان نهج T5 أساسًا للعديد من النماذج اللاحقة:

- **mT5**: نسخة متعددة اللغات من T5، تم تدريبها على مجموعة بيانات **mC4** التي تغطي **101 لغة**<sup>[\[10\]](https://systems-analysis.info/int/T5_-_T5#cite_note-xue2020-mt5-10)</sup>.
- **ByT5**: نسخة تجريبية تتخلى تمامًا عن الترميز (tokenization) وتعمل مباشرة مع **بايتات UTF-8 الخام**. وهذا يجعلها مقاومة للأخطاء الإملائية ويسمح لها بمعالجة أي لغة «افتراضيًا»<sup>[\[11\]](https://systems-analysis.info/int/T5_-_T5#cite_note-xue2022-byt5-11)</sup>.
- **Switch Transformer**: نسخة قابلة للتطوير من T5، طبقت بنية **مزيج الخبراء (Mixture-of-Experts - MoE)**، مما سمح بزيادة عدد المعلمات إلى تريليونات مع الحفاظ على تكاليف حسابية معقولة<sup>[\[12\]](https://systems-analysis.info/int/T5_-_T5#cite_note-fedus2021-switch-12)</sup>.
- **FLAN-T5**: هذه ليست بنية جديدة، بل هي نموذج T5 قياسي خضع لمرحلة إضافية من الضبط الدقيق على مئات المهام المصاغة في شكل تعليمات (*instruction tuning*). وقد أدى ذلك إلى تحسين قدرته على التعميم على مهام جديدة وغير مرئية بشكل كبير في وضع **اللقطة الصفرية** (*zero-shot*) (بدون أمثلة)<sup>[\[13\]](https://systems-analysis.info/int/T5_-_T5#cite_note-chung2022-flan-13)</sup>.
- **UL2**: نموذج يطور أفكار T5، ويستخدم هدف تدريب مسبق جديدًا يسمى **مزيج مزيلات التشويش (Mixture of Denoisers)**، والذي يجمع بين مخططات إخفاء النصوص المختلفة لتحسين الشمولية<sup>[\[14\]](https://systems-analysis.info/int/T5_-_T5#cite_note-tay2022-ul2-14)</sup>.

## روابط خارجية

- <a href="https://github.com/google-research/text-to-text-transfer-transformer" class="external text" rel="nofollow">مستودع T5 الرسمي على GitHub</a>
- <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external text" rel="nofollow">مقال في مدونة Google Research حول أبحاث T5</a>

## المراجع

- Vaswani, A. et al. (2017). *Attention Is All You Need*. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Xue, L. et al. (2021). *mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer*. <a href="https://arxiv.org/abs/2010.11934" class="external text" rel="nofollow">arXiv:2010.11934</a>.
- Dodge, J. et al. (2021). *Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus*. <a href="https://arxiv.org/abs/2104.08758" class="external text" rel="nofollow">arXiv:2104.08758</a>.
- Fedus, W. et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. <a href="https://arxiv.org/abs/2101.03961" class="external text" rel="nofollow">arXiv:2101.03961</a>.
- Ni, J. et al. (2021). *Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models*. <a href="https://arxiv.org/abs/2108.08877" class="external text" rel="nofollow">arXiv:2108.08877</a>.
- Guo, M. et al. (2021). *LongT5: Efficient Text-To-Text Transformer for Long Sequences*. <a href="https://arxiv.org/abs/2112.07916" class="external text" rel="nofollow">arXiv:2112.07916</a>.
- Xue, L. et al. (2022). *ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models*. <a href="https://arxiv.org/abs/2105.13626" class="external text" rel="nofollow">arXiv:2105.13626</a>.
- Tay, Y. et al. (2022). *UL2: Unifying Language Learning Paradigms*. <a href="https://arxiv.org/abs/2205.05131" class="external text" rel="nofollow">arXiv:2205.05131</a>.
- Chung, H. W. et al. (2022). *Scaling Instruction-Finetuned Language Models*. <a href="https://arxiv.org/abs/2210.11416" class="external text" rel="nofollow">arXiv:2210.11416</a>.
- Longpre, S. et al. (2023). *The Flan Collection: Designing Data and Methods for Effective Instruction Tuning*. <a href="https://arxiv.org/abs/2301.13688" class="external text" rel="nofollow">arXiv:2301.13688</a>.

## ملاحظات

1.  <span id="cite_note-raffel2020-1">↑ <sup>[1.0](https://systems-analysis.info/int/T5_-_T5#cite_ref-raffel2020_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/T5_-_T5#cite_ref-raffel2020_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/T5_-_T5#cite_ref-raffel2020_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/T5_-_T5#cite_ref-raffel2020_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/T5_-_T5#cite_ref-raffel2020_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/T5_-_T5#cite_ref-raffel2020_1-5)</sup> Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». *Journal of Machine Learning Research*. <a href="http://jmlr.org/papers/v21/20-074.html" class="external autonumber" rel="nofollow">[١]</a></span>
2.  <span id="cite_note-google-blog-t5-2">↑ <sup>[2.0](https://systems-analysis.info/int/T5_-_T5#cite_ref-google-blog-t5_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/T5_-_T5#cite_ref-google-blog-t5_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/T5_-_T5#cite_ref-google-blog-t5_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/T5_-_T5#cite_ref-google-blog-t5_2-3)</sup> «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». *Google Research Blog*. <a href="https://research.google/blog/exploring-transfer-learning-with-t5-the-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[٢]</a></span>
3.  <span id="cite_note-dhiwise-t5-3">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-dhiwise-t5_3-0) «A Detailed Look At Google's T5 Model in NLP». *DhiWise Blog*. <a href="https://www.dhiwise.com/post/mastering-the-t5-model-for-text-to-text-nlp-task" class="external autonumber" rel="nofollow">[٣]</a></span>
4.  <span id="cite_note-gfg-t5-4">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-gfg-t5_4-0) «T5 (Text-to-Text Transfer Transformer)». *GeeksforGeeks*. <a href="https://www.geeksforgeeks.org/nlp/t5-text-to-text-transfer-transformer/" class="external autonumber" rel="nofollow">[٤]</a></span>
5.  <span id="cite_note-huggingface-t5-doc-5">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-huggingface-t5-doc_5-0) «T5». *Hugging Face Transformers Documentation*. <a href="https://huggingface.co/transformers/v4.12.5/model_doc/t5.html" class="external autonumber" rel="nofollow">[٥]</a></span>
6.  <span id="cite_note-t5-wikipedia-6">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-t5-wikipedia_6-0) «T5 (language model)». In *Wikipedia*. <a href="https://en.wikipedia.org/wiki/T5_(language_model)" class="external autonumber" rel="nofollow">[٦]</a></span>
7.  <span id="cite_note-c4-dataset-pwc-7">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-c4-dataset-pwc_7-0) «C4 Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/c4" class="external autonumber" rel="nofollow">[٧]</a></span>
8.  <span id="cite_note-dodge2021-doc-c4-8">↑ <sup>[8.0](https://systems-analysis.info/int/T5_-_T5#cite_ref-dodge2021-doc-c4_8-0)</sup> <sup>[8.1](https://systems-analysis.info/int/T5_-_T5#cite_ref-dodge2021-doc-c4_8-1)</sup> Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». *arXiv*. <a href="https://arxiv.org/abs/2104.08758" class="external autonumber" rel="nofollow">[٨]</a></span>
9.  <span id="cite_note-reddit-superglue-t5-9">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-reddit-superglue-t5_9-0) «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». *Reddit, r/linguistics*. <a href="https://www.reddit.com/r/linguistics/comments/dmtr38/google_t5_algorithm_scores_889_on_superglue/" class="external autonumber" rel="nofollow">[٩]</a></span>
10. <span id="cite_note-xue2020-mt5-10">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-xue2020-mt5_10-0) Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». *arXiv*. <a href="https://arxiv.org/abs/2010.11934" class="external autonumber" rel="nofollow">[١٠]</a></span>
11. <span id="cite_note-xue2022-byt5-11">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-xue2022-byt5_11-0) Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». *arXiv*. <a href="https://arxiv.org/abs/2105.13626" class="external autonumber" rel="nofollow">[١١]</a></span>
12. <span id="cite_note-fedus2021-switch-12">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-fedus2021-switch_12-0) Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». *arXiv*. <a href="https://arxiv.org/abs/2101.03961" class="external autonumber" rel="nofollow">[١٢]</a></span>
13. <span id="cite_note-chung2022-flan-13">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-chung2022-flan_13-0) Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». *arXiv*. <a href="https://arxiv.org/abs/2210.11416" class="external autonumber" rel="nofollow">[١٣]</a></span>
14. <span id="cite_note-tay2022-ul2-14">[↑](https://systems-analysis.info/int/T5_-_T5#cite_ref-tay2022-ul2_14-0) Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». *arXiv*. <a href="https://arxiv.org/abs/2205.05131" class="external autonumber" rel="nofollow">[١٤]</a></span>
