T5 (Text-to-Text Transfer Transformer) (HI)

From Systems analysis Wiki
Jump to navigation Jump to search

T5 (Text-to-Text Transfer Transformer) — यह Google AI के शोधकर्ताओं द्वारा विकसित और 2019 में प्रस्तुत किए गए बड़े भाषा मॉडलों का एक परिवार है[1]। T5 का मुख्य नवाचार «text-to-text» का एकीकृत framework है, जो प्राकृतिक भाषा प्रसंस्करण (NLP) की किसी भी समस्या को एक पाठ अनुक्रम को दूसरे में रूपांतरित करने की समस्या के रूप में देखता है। इससे अनुवाद, सारांशीकरण, प्रश्नोत्तर और वर्गीकरण जैसे व्यापक कार्यों के लिए एकल मॉडल, हानि फ़ंक्शन और प्रशिक्षण प्रक्रिया का उपयोग संभव हुआ[2]

यह मॉडल मानक encoder-decoder transformer architecture पर आधारित है, जो इसे BERT (केवल encoder) और GPT (केवल decoder) जैसे मॉडलों से अलग करता है। T5 पर कार्य को NLP में transfer learning की विभिन्न विधियों के व्यवस्थित अध्ययन और तुलना के लिए एक बड़े पैमाने के अनुभवजन्य अनुसंधान के रूप में परिकल्पित किया गया था, न कि किसी मौलिक रूप से नई पद्धति के निर्माण के रूप में[1]

«Text-to-Text» प्रतिमान

T5 का केंद्रीय विचार यह है कि सभी कार्यों को एकसमान प्रारूप में तैयार किया जाता है। मॉडल इनपुट के रूप में पाठ प्राप्त करता है और आउटपुट के रूप में भी पाठ उत्पन्न करता है। मॉडल को दिए गए कार्यों में अंतर करने में सक्षम बनाने के लिए, इनपुट अनुक्रम में एक विशेष पाठ उपसर्ग-निर्देश जोड़ा जाता है[2]

  • अनुवाद: `translate English to German: That is good.` → `Das ist gut.`
  • भाव वर्गीकरण: `sst2 sentence: a very exciting film.` → `positive`
  • सारांशीकरण: `summarize: [लंबा लेख पाठ]` → `[संक्षिप्त सारांश]`

यह दृष्टिकोण मॉडल के अनुप्रयोग की प्रक्रिया को आमूल रूप से सरल बनाता है, प्रत्येक अलग कार्य के लिए विशिष्ट «हेड» (task-specific heads) विकसित करने की आवश्यकता को समाप्त करता है, जो BERT जैसी architectures की विशेषता थी[3]

Architecture और स्केलिंग

Encoder-Decoder Architecture

T5 मानक transformer architecture का उपयोग करता है, जिसमें दो भाग होते हैं[1]:

  • Encoder: संपूर्ण इनपुट अनुक्रम को एक साथ संसाधित करता है, जिससे एक समृद्ध प्रासंगिक representation तैयार होती है। BERT की तरह, T5 का encoder द्विदिशात्मक है।
  • Decoder: encoder से प्राप्त representation का उपयोग करते हुए, आउटपुट पाठ को token-दर-token (autoregressive रूप से) उत्पन्न करता है।

यह संकर संरचना T5 को भाषा बोधगम्यता और पाठ उत्पादन दोनों प्रकार के कार्यों को प्रभावी ढंग से हल करने में सक्षम बनाती है[4]

प्रमुख सुधार

T5 की architecture में मूल transformer मॉडल की तुलना में कई परिवर्तन शामिल हैं:

  • सापेक्ष Positional Embeddings: पूर्ण साइनसॉइडल embeddings के स्थान पर T5 सापेक्ष स्थिति कोडिंग के एक सरल किंतु प्रभावी रूप का उपयोग करता है, जहाँ attention logits में एक learnable scalar bias जोड़ा जाता है, जो केवल tokens के बीच की सापेक्ष दूरी पर निर्भर करता है[1]
  • संशोधित Layer Normalization (Layer Norm): Normalization को residual connection के बाहर रखा गया है, और प्रशिक्षण स्थिरता बढ़ाने के लिए इससे additive bias हटा दिया गया है।

मॉडल के आकार

मूल शोध में मॉडल को कई कॉन्फ़िगरेशन में प्रस्तुत किया गया था, जो पैरामीटरों की संख्या में भिन्न थे, जिससे स्केल के प्रभाव का व्यवस्थित अध्ययन संभव हुआ[5]:

  • T5-Small: ~6 करोड़ पैरामीटर
  • T5-Base: ~22 करोड़ पैरामीटर
  • T5-Large: ~77 करोड़ पैरामीटर
  • T5-3B: ~3 अरब पैरामीटर
  • T5-11B: ~11 अरब पैरामीटर

शोध से पता चला कि मॉडल के स्केल को बढ़ाना उसके प्रदर्शन में सुधार के सबसे विश्वसनीय तरीकों में से एक है[1]

पूर्व-प्रशिक्षण: C4 Dataset और Span Corruption कार्य

Span Corruption कार्य

T5 के पूर्व-प्रशिक्षण के लिए noise हटाने (denoising) का कार्य चुना गया, विशेष रूप से इसका एक संस्करण जिसे खंड क्षति (span corruption) कहते हैं[6]। यह विधि निम्न प्रकार कार्य करती है:

  1. इनपुट पाठ में 15% tokens को यादृच्छिक रूप से mask किया जाता है।
  2. BERT की MLM विधि के विपरीत, जहाँ अलग-अलग tokens को mask किया जाता है, T5 में पूरे निरंतर खंडों (spans) को mask किया जाता है।
  3. प्रत्येक क्षतिग्रस्त खंड को एक अद्वितीय mask token से बदला जाता है (उदाहरण के लिए, `<X>`, `<Y>`)।
  4. मॉडल को आउटपुट में हटाए गए खंडों का अनुक्रम उत्पन्न करने के लिए प्रशिक्षित किया जाता है, जो संबंधित masks द्वारा अलग किए जाते हैं।

यह दृष्टिकोण मॉडल को पाठ के पूरे अनुक्रमों की भविष्यवाणी करने के लिए बाध्य करता है, जो पूर्व-प्रशिक्षण के लिए सामान्य भाषा मॉडलिंग की तुलना में अधिक प्रभावी कार्य साबित हुआ[1]

C4 Dataset (Colossal Clean Crawled Corpus)

Transfer learning की संभावनाओं को साकार करने के लिए शोधकर्ताओं ने लगभग 750 GB आकार का एक विशाल और उच्च गुणवत्ता से साफ किया गया पाठ डेटा संग्रह C4 बनाया[2]। इसे सार्वजनिक रूप से उपलब्ध वेब corpus Common Crawl की बड़े पैमाने पर सफाई और फ़िल्टरिंग द्वारा प्राप्त किया गया था[7]। सफाई प्रक्रिया में डुप्लीकेट, शाब्लोनिक पाठ ("Lorem ipsum"), अधूरे वाक्यों को हटाना, तथा अश्लील शब्दावली की फ़िल्टरिंग शामिल थी[8]

C4 Dataset की आलोचना

«स्वच्छ» corpus बनाने के घोषित उद्देश्य के बावजूद, C4 की फ़िल्टरिंग प्रक्रिया पर व्यवस्थित पूर्वाग्रहों के कारण आलोचना हुई। अध्ययनों से पता चला कि अश्लील शब्दावली फ़िल्टर ने LGBTQ+ समुदायों से संबंधित पाठों के साथ-साथ अफ्रीकी-अमेरिकी अंग्रेज़ी (AAE) के पाठों को असमान रूप से हटा दिया[8]। इसके अतिरिक्त, dataset में आपत्तिजनक और कॉपीराइट-संरक्षित सामग्री की पर्याप्त मात्रा पाई गई। ये समस्याएं वस्तुनिष्ठ रूप से «गुणवत्तापूर्ण» dataset बनाने की जटिलता और फ़िल्टरिंग के तकनीकी निर्णयों से अनजाने में उत्पन्न होने वाले सामाजिक पूर्वाग्रहों को उजागर करती हैं।

परिणाम और प्रदर्शन

प्रकाशन के समय T5 ने GLUE, SuperGLUE, SQuAD और सारांशीकरण कार्यों सहित अनेक benchmark पर नए प्रदर्शन रिकॉर्ड (state-of-the-art) स्थापित किए[2]। विशेष रूप से, T5-11B मॉडल ने SuperGLUE पर मानव स्तर के निकट परिणाम प्राप्त किया, जिससे जटिल तार्किक अनुमान की आवश्यकता वाले कार्यों को संभालने की उसकी क्षमता प्रदर्शित हुई[9]। इन परिणामों ने शोध की केंद्रीय परिकल्पना की पुष्टि की: एकीकृत framework, बड़े स्केल और गुणवत्तापूर्ण dataset का संयोजन NLP में अग्रणी परिणाम प्राप्त करने के लिए एक अत्यंत शक्तिशाली रणनीति है।

T5 का विकास और रूपांतर

T5 दृष्टिकोण ने अनेक परवर्ती मॉडलों का आधार बनाया:

  • mT5: T5 का बहुभाषीय संस्करण, जिसे 101 भाषाओं को कवर करने वाले mC4 corpus पर प्रशिक्षित किया गया है[10]
  • ByT5: एक प्रायोगिक संस्करण जो tokenization को पूरी तरह त्याग देता है और सीधे कच्चे UTF-8 bytes के साथ कार्य करता है। यह इसे टाइपो के प्रति प्रतिरोधी बनाता है और «बिना किसी सेटअप के» किसी भी भाषा को संसाधित करने में सक्षम बनाता है[11]
  • Switch Transformer: T5 का एक स्केलेबल संस्करण, जिसने Mixture-of-Experts (MoE) architecture को लागू किया, जिससे उचित कम्प्यूटेशनल लागत बनाए रखते हुए पैरामीटरों की संख्या को ट्रिलियन तक बढ़ाना संभव हुआ[12]
  • FLAN-T5: यह कोई नई architecture नहीं है, बल्कि मानक T5 है जो सैकड़ों कार्यों पर निर्देशों के रूप में तैयार किए गए अतिरिक्त fine-tuning चरण (instruction tuning) से गुज़री है। इससे zero-shot (बिना उदाहरणों के) मोड में नए, अनदेखे कार्यों पर सामान्यीकरण करने की उसकी क्षमता में उल्लेखनीय वृद्धि हुई[13]
  • UL2: T5 के विचारों को विकसित करने वाला एक मॉडल, जो Mixture of Denoisers नामक नए पूर्व-प्रशिक्षण objective का उपयोग करता है, जो बेहतर सार्वभौमिकता के लिए पाठ masking की विभिन्न योजनाओं को संयोजित करता है[14]

संदर्भ

  • GitHub पर T5 का आधिकारिक repository
  • T5 शोध पर Google Research ब्लॉग पोस्ट

साहित्य

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
  • Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
  • Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
  • Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
  • Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
  • Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
  • Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
  • Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
  • Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.

टिप्पणियाँ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [१]
  2. 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [२]
  3. «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [३]
  4. «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [४]
  5. «T5». Hugging Face Transformers Documentation. [५]
  6. «T5 (language model)». In Wikipedia. [६]
  7. «C4 Dataset». Papers With Code. [७]
  8. 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [८]
  9. «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [९]
  10. Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [१०]
  11. Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [११]
  12. Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [१२]
  13. Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [१३]
  14. Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [१४]