T5 (Text-to-Text Transfer Transformer) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

T5 (Text-to-Text Transfer Transformer) — یہ بڑے لسانی ماڈلز کا ایک خاندان ہے جسے Google AI کے محققین نے تیار کیا اور 2019 میں پیش کیا[1]۔ T5 کی بنیادی اختراع «text-to-text» کا یکجا فریم ورک ہے، جو قدرتی زبان کی پروسیسنگ (NLP) کے ہر مسئلے کو ایک متنی تسلسل کو دوسرے میں تبدیل کرنے کے مسئلے کے طور پر دیکھتا ہے۔ اس سے ترجمہ، خلاصہ نویسی، سوال و جواب اور درجہ بندی جیسے وسیع پیمانے پر کاموں کے لیے ایک ہی ماڈل، نقصان کا فنکشن اور تربیتی طریقہ کار استعمال کرنا ممکن ہوا[2]۔

یہ ماڈل transformer کے معیاری «انکوڈر-ڈیکوڈر» فن تعمیر پر مبنی ہے، جو اسے BERT (صرف انکوڈر) اور GPT (صرف ڈیکوڈر) قسم کے ماڈلز سے ممتاز کرتا ہے۔ T5 پر کام کو NLP میں منتقلی سیکھنے کے مختلف طریقوں کا منظم طریقے سے مطالعہ اور موازنہ کرنے کے لیے ایک وسیع تجرباتی تحقیق کے طور پر تصور کیا گیا تھا، نہ کہ کوئی بنیادی طور پر نیا طریقہ بنانے کے لیے[1]۔

«Text-to-Text» - متن سے متن کا اصول

T5 کا مرکزی خیال یہ ہے کہ تمام کام ایک ہی یکساں فارمیٹ میں بیان کیے جاتے ہیں۔ ماڈل متن بطور input وصول کرتا ہے اور output میں بھی متن ہی تیار کرتا ہے۔ تاکہ ماڈل اپنے سامنے رکھے گئے کاموں کو پہچان سکے، ان پٹ تسلسل میں ایک خاص متنی پریفکس-ہدایت شامل کی جاتی ہے[2]۔

  • ترجمہ: `translate English to German: That is good.` → `Das ist gut.`
  • جذباتی درجہ بندی: `sst2 sentence: a very exciting film.` → `positive`
  • خلاصہ نویسی: `summarize: [طویل مضمون کا متن]` → `[مختصر خلاصہ]`

یہ طریقہ کار ماڈل کے استعمال کے عمل کو بنیادی طور پر آسان بنا دیتا ہے، کیونکہ ہر علیحدہ کام کے لیے مخصوص «سر» (task-specific heads) بنانے کی ضرورت ختم ہو جاتی ہے، جو BERT جیسے فن تعمیر میں عام تھی[3]۔

فن تعمیر اور پیمانہ

انکوڈر-ڈیکوڈر فن تعمیر

T5 transformer کے معیاری فن تعمیر کا استعمال کرتا ہے جو دو حصوں پر مشتمل ہے[1]:

  • انکوڈر: پورے ان پٹ تسلسل کو بیک وقت پروسیس کرتا ہے اور ایک بھرپور سیاقی نمائندگی تخلیق کرتا ہے۔ BERT کی طرح، T5 کا انکوڈر دو طرفہ ہے۔
  • ڈیکوڈر: انکوڈر سے حاصل کردہ نمائندگی کا استعمال کرتے ہوئے، آؤٹ پٹ متن کو token بہ token (خود-انحصاری طور پر) تیار کرتا ہے۔

یہ ہائبرڈ ڈھانچہ T5 کو زبان کو سمجھنے اور متن تیار کرنے دونوں قسم کے کاموں کو مؤثر طریقے سے انجام دینے کے قابل بناتا ہے[4]۔

اہم بہتریاں

T5 کا فن تعمیر اصل transformer ماڈل کے مقابلے میں کئی تبدیلیاں شامل کرتا ہے:

  • رشتہ دار پوزیشنی embedding: مطلق sinusoidal embedding کی بجائے، T5 رشتہ دار پوزیشن کوڈنگ کی ایک آسان لیکن مؤثر شکل استعمال کرتا ہے، جہاں attention کے logits میں ایک قابل تربیت scalar bias شامل کیا جاتا ہے جو صرف tokens کے درمیان نسبتاً فاصلے پر منحصر ہوتا ہے[1]۔
  • ترمیم شدہ Layer Norm: نارملائزیشن کو residual connection سے باہر نکالا گیا ہے، اور تربیت کے استحکام کو بڑھانے کے لیے اس میں سے additive bias کو ہٹا دیا گیا ہے۔

ماڈل کے پیمانے

اصل تحقیق میں ماڈل کو پیرامیٹرز کی تعداد میں مختلف کئی کنفیگریشنز میں پیش کیا گیا، جس سے پیمانے کے اثر کا منظم مطالعہ ممکن ہوا[5]:

  • T5-Small: ~60 ملین پیرامیٹرز
  • T5-Base: ~220 ملین پیرامیٹرز
  • T5-Large: ~770 ملین پیرامیٹرز
  • T5-3B: ~3 ارب پیرامیٹرز
  • T5-11B: ~11 ارب پیرامیٹرز

تحقیق سے ثابت ہوا کہ ماڈل کے پیمانے میں اضافہ اس کی کارکردگی بڑھانے کے سب سے قابل اعتماد طریقوں میں سے ایک ہے[1]۔

پیشگی تربیت: C4 dataset اور Span Corruption کا کام

Span Corruption کا کام

T5 کی پیشگی تربیت کے لیے شور ہٹانے (denoising) کا کام منتخب کیا گیا، یعنی اس کا وہ خاص قسم جسے فرگمنٹ کو نقصان پہنچانا (span corruption) کہا جاتا ہے[6]۔ یہ طریقہ اس طرح کام کرتا ہے:

  1. ان پٹ متن میں 15 فیصد tokens کو بے ترتیب طور پر mask کیا جاتا ہے۔
  2. BERT میں MLM کے طریقے کے برعکس، جہاں انفرادی tokens کو mask کیا جاتا ہے، T5 میں پورے مسلسل فرگمنٹس (spans) کو mask کیا جاتا ہے۔
  3. ہر نقصان پہنچے فرگمنٹ کو ایک منفرد mask token سے بدل دیا جاتا ہے (مثلاً `<X>`, `<Y>`)۔
  4. ماڈل کو آؤٹ پٹ میں حذف شدہ فرگمنٹس کی ترتیب، جو متعلقہ masks سے الگ کی گئی ہو، تیار کرنا سکھایا جاتا ہے۔

یہ طریقہ ماڈل کو متن کی پوری ترتیبیں پیش گوئی کرنے پر مجبور کرتا ہے، جو سادہ زبان ماڈلنگ کے مقابلے میں پیشگی تربیت کے لیے زیادہ مؤثر کام ثابت ہوا[1]۔

C4 (Colossal Clean Crawled Corpus) Dataset

منتقلی سیکھنے کی صلاحیت کو بروئے کار لانے کے لیے محققین نے تقریباً 750 GB حجم کا ایک بہت بڑا اور اعلیٰ معیار کا صاف شدہ متنی ڈیٹا سیٹ C4 تخلیق کیا[2]۔ یہ عوامی طور پر دستیاب ویب کارپس Common Crawl کی بڑے پیمانے پر صفائی اور فلٹریشن کے ذریعے حاصل کیا گیا[7]۔ صفائی کے عمل میں ڈپلیکیٹس، سانچہ متن ("Lorem ipsum")، نامکمل جملوں کو ہٹانا اور نامناسب زبان کو فلٹر کرنا شامل تھا[8]۔

C4 Dataset پر تنقید

«صاف» کارپس بنانے کے اعلان کردہ مقصد کے باوجود، C4 کے فلٹریشن عمل کو منظم تعصب کی وجہ سے تنقید کا نشانہ بنایا گیا۔ تحقیقات سے ثابت ہوا کہ نامناسب زبان کا فلٹر LGBTQ+ کمیونٹیز سے متعلق متون اور افریقی-امریکی انگریزی (AAE) کے متون کو غیر متناسب طریقے سے ہٹا رہا تھا[8]۔ اس کے علاوہ، dataset میں کافی مقدار میں توہین آمیز اور کاپی رائٹ سے محفوظ مواد بھی پایا گیا۔ یہ مسائل معروضی طور پر «معیاری» ڈیٹا سیٹس بنانے کی پیچیدگی اور اس بات کی عکاسی کرتے ہیں کہ فلٹریشن کے تکنیکی فیصلے کس طرح غیر ارادی سماجی تعصبات کا باعث بن سکتے ہیں۔

نتائج اور کارکردگی

اشاعت کے وقت T5 نے GLUE، SuperGLUE، SQuAD اور خلاصہ نویسی کے کاموں سمیت متعدد benchmark پر نئے کارکردگی کے ریکارڈ (state-of-the-art) قائم کیے[2]۔ خاص طور پر، T5-11B ماڈل نے SuperGLUE پر انسانی سطح کے قریب نتیجہ حاصل کیا، جس سے پیچیدہ منطقی استدلال کی ضرورت والے کاموں کو سنبھالنے کی صلاحیت ظاہر ہوئی[9]۔ ان نتائج نے تحقیق کے مرکزی مفروضے کی تصدیق کی: یکجا فریم ورک، بڑے پیمانے اور معیاری ڈیٹا سیٹ کا مجموعہ NLP میں سب سے آگے کے نتائج حاصل کرنے کی ایک انتہائی طاقتور حکمت عملی ہے۔

T5 کا ارتقاء اور اس کی اقسام

T5 کا طریقہ کار بعد میں آنے والے متعدد ماڈلز کی بنیاد بنا:

  • mT5: T5 کا کثیر لسانی ورژن جو 101 زبانوں پر محیط mC4 کارپس پر تربیت یافتہ ہے[10]۔
  • ByT5: ایک تجرباتی ورژن جو tokenization کو مکمل طور پر ترک کر دیتا ہے اور براہِ راست خام UTF-8 bytes کے ساتھ کام کرتا ہے۔ یہ اسے ٹائپنگ غلطیوں کے خلاف مضبوط بناتا ہے اور «آؤٹ آف دی باکس» کسی بھی زبان کو پروسیس کرنے کی اجازت دیتا ہے[11]۔
  • Switch Transformer: T5 کا قابل توسیع ورژن جس نے Mixture-of-Experts (MoE) فن تعمیر متعارف کرایا، جس سے معقول کمپیوٹیشنل لاگت برقرار رکھتے ہوئے پیرامیٹرز کی تعداد کو کھربوں تک بڑھانا ممکن ہوا[12]۔
  • FLAN-T5: یہ کوئی نیا فن تعمیر نہیں، بلکہ وہی معیاری T5 ہے جو ہدایات کی شکل میں بیان کردہ سینکڑوں کاموں پر اضافی fine-tuning (instruction tuning) کے مرحلے سے گزری ہے۔ اس سے نئے، انجانے کاموں پر zero-shot (بغیر مثالوں کے) کی حالت میں اس کی تعمیم کی صلاحیت میں نمایاں اضافہ ہوا[13]۔
  • UL2: T5 کے خیالات کو آگے بڑھانے والا ایک ماڈل جو Mixture of Denoisers نامی نئے پیشگی تربیتی ہدف کا استعمال کرتا ہے، جو عالمگیریت کو بہتر بنانے کے لیے متن کی masking کی مختلف اسکیموں کو یکجا کرتا ہے[14]۔

روابط

  • GitHub پر T5 کا سرکاری ریپوزٹری
  • T5 تحقیق کے بارے میں Google Research کے بلاگ پر مضمون

کتابیات

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
  • Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
  • Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
  • Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
  • Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
  • Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
  • Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
  • Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
  • Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.

حواشی

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [1]
  2. 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [2]
  3. «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [3]
  4. «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [4]
  5. «T5». Hugging Face Transformers Documentation. [5]
  6. «T5 (language model)». In Wikipedia. [6]
  7. «C4 Dataset». Papers With Code. [7]
  8. 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [8]
  9. «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [9]
  10. Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [10]
  11. Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [11]
  12. Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [12]
  13. Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [13]
  14. Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [14]