T5 - T5

From Systems analysis Wiki
Jump to navigation Jump to search

T5 (اختصار لـ Text-to-Text Transfer Transformer) هي عائلة من نماذج اللغة الكبيرة التي طورها باحثو Google AI وقُدمت في عام 2019[1]. الابتكار الرئيسي في T5 هو إطار العمل الموحد «نص-إلى-نص» (text-to-text)، الذي يتعامل مع أي مهمة في معالجة اللغات الطبيعية (NLP) كمشكلة تحويل سلسلة نصية إلى أخرى. وقد سمح ذلك باستخدام نموذج واحد، ودالة خسارة واحدة، وإجراء تدريب واحد لمجموعة واسعة من المهام، مثل الترجمة، والتلخيص، والإجابة على الأسئلة، والتصنيف[2].

يعتمد النموذج على بنية المحول القياسية «المُشفِّر-المُفكِّك»، مما يميزه عن نماذج مثل BERT (المُشفِّر فقط) و GPT (المُفكِّك فقط). لقد صُمم العمل على T5 كدراسة تجريبية واسعة النطاق لدراسة ومقارنة منهجيات التعلم بالنقل المختلفة في معالجة اللغات الطبيعية بشكل منهجي، وليس كابتكار طريقة جديدة جوهريًا[1].

Text-to-Text paradigm - إطار عمل «نص-إلى-نص»

الفكرة المركزية في T5 هي أن جميع المهام تُصاغ في شكل موحد. يتلقى النموذج نصًا كمدخل ويُنشئ نصًا كمخرج. ولكي يتمكن النموذج من التمييز بين المهام الموكلة إليه، تُضاف بادئة نصية إرشادية خاصة إلى تسلسل الإدخال[2].

  • الترجمة: `translate English to German: That is good.` → `Das ist gut.`
  • تصنيف المشاعر: `sst2 sentence: a very exciting film.` → `positive`
  • التلخيص: `summarize: [نص مقال طويل]` → `[ملخص موجز]`

يبسط هذا النهج بشكل جذري عملية تطبيق النموذج، مما يلغي الحاجة إلى تطوير «رؤوس» خاصة بالمهام (task-specific heads) لكل مهمة على حدة، وهو ما كان شائعًا في البنى الهندسية مثل BERT[3].

البنية والتوسع

بنية المُشفِّر-المُفكِّك

يستخدم T5 بنية المحول القياسية، التي تتكون من جزأين[1]:

  • المُشفِّر (Encoder): يعالج تسلسل الإدخال بأكمله في وقت واحد، مما يُنشئ تمثيلًا غنيًا بالسياق. وكما هو الحال في BERT، فإن مُشفِّر T5 ثنائي الاتجاه.
  • المُفكِّك (Decoder): يُنشئ النص الناتج رمزًا تلو الآخر (بشكل ذاتي الانحدار)، مستخدمًا التمثيل الذي تم الحصول عليه من المُشفِّر.

تسمح هذه البنية الهجينة لـ T5 بحل مهام فهم اللغة ومهام توليد النصوص بفعالية[4].

التحسينات الرئيسية

تتضمن بنية T5 عدة تغييرات مقارنة بنموذج المحول الأصلي:

  • التضمينات الموضعية النسبية: بدلاً من التضمينات الجيبية المطلقة، يستخدم T5 شكلاً مبسطًا ولكنه فعال من الترميز الموضعي النسبي، حيث يُضاف إلى لوجيتات الانتباه انحياز قياسي قابل للتعلم (bias) يعتمد فقط على المسافة النسبية بين الرموز[1].
  • تسوية الطبقات المعدلة (Layer Norm): تم نقل التسوية إلى خارج الاتصال المتبقي (residual connection)، وأُزيل منها الانحياز الجمعي (bias) لزيادة استقرار التدريب.

أحجام النموذج

في الورقة البحثية الأصلية، قُدم النموذج في عدة تكوينات تختلف في عدد المعلمات، مما سمح بدراسة تأثير الحجم بشكل منهجي[5]:

  • T5-Small: حوالي 60 مليون معلمة
  • T5-Base: حوالي 220 مليون معلمة
  • T5-Large: حوالي 770 مليون معلمة
  • T5-3B: حوالي 3 مليارات معلمة
  • T5-11B: حوالي 11 مليار معلمة

أظهرت الدراسة أن زيادة حجم النموذج هي إحدى أكثر الطرق موثوقية لتعزيز أدائه[1].

التدريب المسبق: مجموعة بيانات C4 ومهمة إفساد الامتداد

مهمة إفساد الامتداد (Span Corruption)

للتدريب المسبق لـ T5، تم اختيار مهمة إزالة التشويش (denoising)، وتحديدًا متغيرها المسمى إفساد الامتداد (span corruption)[6]. تعمل الطريقة على النحو التالي:

  1. في النص المدخل، يتم إخفاء 15% من الرموز بشكل عشوائي.
  2. على عكس طريقة MLM في BERT، حيث يتم إخفاء رموز فردية، في T5 يتم إخفاء امتدادات (spans) متصلة كاملة.
  3. يُستبدل كل امتداد تالف برمز قناع فريد واحد (على سبيل المثال، `<X>`، `<Y>`).
  4. يُدرب النموذج على توليد تسلسل من الامتدادات المحذوفة في المخرجات، مفصولة بالأقنعة المقابلة لها.

يجبر هذا النهج النموذج على التنبؤ بتسلسلات كاملة من النص، وهو ما أثبت أنه مهمة أكثر فعالية للتدريب المسبق من مجرد نمذجة اللغة[1].

مجموعة بيانات C4 (Colossal Clean Crawled Corpus)

لتحقيق إمكانات التعلم بالنقل، أنشأ الباحثون مجموعة بيانات نصية ضخمة ونظيفة الجودة تسمى C4، بحجم حوالي 750 جيجابايت[2]. تم الحصول عليها من خلال عملية تنظيف وتصفية واسعة النطاق لمستودع الويب المتاح للجمهور Common Crawl[7]. تضمنت عملية التنظيف إزالة التكرارات، والنصوص النموذجية ("Lorem ipsum")، والجمل غير المكتملة، بالإضافة إلى تصفية المفردات البذيئة[8].

الانتقادات الموجهة لمجموعة بيانات C4

على الرغم من الهدف المعلن لإنشاء مجموعة بيانات «نظيفة»، تعرضت عملية تصفية C4 لانتقادات بسبب الانحيازات المنهجية. أظهرت الأبحاث أن مرشح المفردات البذيئة أزال بشكل غير متناسب النصوص المتعلقة بمجتمعات LGBTQ+، بالإضافة إلى النصوص باللغة الإنجليزية الأمريكية من أصل أفريقي (AAE)[8]. علاوة على ذلك، تم اكتشاف كمية كبيرة من المحتوى المسيء والمحمي بحقوق الطبع والنشر في مجموعة البيانات. توضح هذه المشكلات مدى صعوبة إنشاء مجموعات بيانات «عالية الجودة» بشكل موضوعي وكيف يمكن أن تؤدي القرارات التقنية المتعلقة بالتصفية إلى انحيازات اجتماعية غير مقصودة.

النتائج والأداء

في وقت نشره، سجل T5 أرقامًا قياسية جديدة في الأداء (state-of-the-art) في العديد من معايير الأداء، بما في ذلك GLUE، وSuperGLUE، وSQuAD، ومهام التلخيص[2]. على وجه الخصوص، حقق نموذج T5-11B على SuperGLUE نتيجة قريبة من مستوى الأداء البشري، مما أظهر قدرته على التعامل مع المهام التي تتطلب استدلالًا منطقيًا معقدًا[9]. أكدت هذه النتائج الفرضية المركزية للدراسة: أن الجمع بين إطار عمل موحد، وحجم كبير، ومجموعة بيانات عالية الجودة يمثل استراتيجية قوية للغاية لتحقيق نتائج متقدمة في معالجة اللغات الطبيعية.

التطور ومتغيرات T5

كان نهج T5 أساسًا للعديد من النماذج اللاحقة:

  • mT5: نسخة متعددة اللغات من T5، تم تدريبها على مجموعة بيانات mC4 التي تغطي 101 لغة[10].
  • ByT5: نسخة تجريبية تتخلى تمامًا عن الترميز (tokenization) وتعمل مباشرة مع بايتات UTF-8 الخام. وهذا يجعلها مقاومة للأخطاء الإملائية ويسمح لها بمعالجة أي لغة «افتراضيًا»[11].
  • Switch Transformer: نسخة قابلة للتطوير من T5، طبقت بنية مزيج الخبراء (Mixture-of-Experts - MoE)، مما سمح بزيادة عدد المعلمات إلى تريليونات مع الحفاظ على تكاليف حسابية معقولة[12].
  • FLAN-T5: هذه ليست بنية جديدة، بل هي نموذج T5 قياسي خضع لمرحلة إضافية من الضبط الدقيق على مئات المهام المصاغة في شكل تعليمات (instruction tuning). وقد أدى ذلك إلى تحسين قدرته على التعميم على مهام جديدة وغير مرئية بشكل كبير في وضع اللقطة الصفرية (zero-shot) (بدون أمثلة)[13].
  • UL2: نموذج يطور أفكار T5، ويستخدم هدف تدريب مسبق جديدًا يسمى مزيج مزيلات التشويش (Mixture of Denoisers)، والذي يجمع بين مخططات إخفاء النصوص المختلفة لتحسين الشمولية[14].

روابط خارجية

المراجع

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
  • Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
  • Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
  • Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
  • Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
  • Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
  • Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
  • Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
  • Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.

ملاحظات

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [١]
  2. 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [٢]
  3. «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [٣]
  4. «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [٤]
  5. «T5». Hugging Face Transformers Documentation. [٥]
  6. «T5 (language model)». In Wikipedia. [٦]
  7. «C4 Dataset». Papers With Code. [٧]
  8. 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [٨]
  9. «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [٩]
  10. Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [١٠]
  11. Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [١١]
  12. Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [١٢]
  13. Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [١٣]
  14. Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [١٤]