Transformer architecture — ट्रांसफॉर्मर आर्किटेक्चर
Transformer आर्किटेक्चर — यह एक Neural Network आर्किटेक्चर है, जिसे 2017 में Google के शोधकर्ताओं ने «Attention Is All You Need» शीर्षक के शोधपत्र में प्रस्तुत किया था[1]। इसने Natural Language Processing (NLP) के क्षेत्र में क्रांति ला दी और BERT, GPT तथा Gemini जैसे अधिकांश आधुनिक Large Language Models (LLM) की नींव बन गई। Transformer की प्रमुख नवीनता Self‑Attention का तंत्र है, जो मॉडल को इनपुट डेटा के विभिन्न भागों के महत्व को तौलने और अनुक्रमों को समानांतर में संसाधित करने की अनुमति देता है — इस प्रकार RNN और LSTM में निहित पुनरावर्तता (recurrence) को त्याग दिया गया।
ऐतिहासिक संदर्भ और पूर्वापेक्षाएँ
2017 से पहले, अनुक्रमिक डेटा जैसे पाठ को संसाधित करने के लिए प्रमुख आर्किटेक्चर Recurrent Neural Networks (RNN) और उनका उन्नत संस्करण — Long Short-Term Memory (LSTM) नेटवर्क — थे।
RNN/LSTM की समस्याएँ जिन्हें Transformer ने संबोधित किया
- अनुक्रमिक प्रसंस्करण की सीमाएँ: RNN और LSTM डेटा को token दर token संसाधित करते हैं, जिससे अनुक्रम के भीतर समानांतरता संभव नहीं होती और बड़े डेटा पर प्रशिक्षण धीमा हो जाता है।
- विलुप्त होते और विस्फोट होते Gradient की समस्या: लंबे अनुक्रमों में, कई चरणों से पीछे की ओर प्रसारित होने वाले gradient या तो क्षीण हो सकते हैं या बढ़ सकते हैं, जिससे दीर्घकालिक निर्भरताओं का प्रशिक्षण कठिन हो जाता है।
- दीर्घकालिक निर्भरताएँ: अनुक्रम की शुरुआत की जानकारी उसके अंत तक पहुँचते-पहुँचते खो सकती है।
Transformer का दृष्टिकोण — ध्यान तंत्र के पक्ष में पुनरावर्तता का पूर्ण परित्याग है। यह किसी भी दो स्थितियों के बीच निर्भरता पथ की स्थिर लंबाई सुनिश्चित करता है (), जिससे दूरस्थ निर्भरताओं का मॉडलिंग सरल हो जाता है, जबकि Self-Attention के आधारभूत कार्यान्वयन की अनुक्रम लंबाई के सापेक्ष द्विघाती (quadratic) कम्प्यूटेशनल जटिलता होती है ()[1][2]। Gradient के क्षीण होने/विस्फोट की समस्या «समाप्त» नहीं होती, बल्कि residual connections, LayerNorm और प्रशिक्षण विधि के माध्यम से कम की जाती है; आधुनिक कार्यान्वयनों में अक्सर Pre‑LayerNorm (Pre‑LN) का उपयोग किया जाता है, जो प्रशिक्षण में अधिक स्थिर माना जाता है[3]।
आर्किटेक्चर और प्रमुख घटक
मूल Transformer आर्किटेक्चर दो मुख्य भागों से मिलकर बना है: एन्कोडर और डिकोडर। दोनों घटक समान परतों के स्तूप (stack) हैं (मूल शोधपत्र में )[1]।
- एन्कोडर परत की संरचना: (1) Multi-Head Attention (MHA), (2) Position-wise FFN; प्रत्येक उप-परत residual connection और LayerNorm से घिरी होती है[1]।
- डिकोडर परत की संरचना: (1) Masked Self-Attention (causal mask भविष्य की स्थितियों तक पहुँच को प्रतिबंधित करता है), (2) एन्कोडर के आउटपुट के प्रति Cross‑Attention, (3) FFN — residuals और LayerNorm के साथ[1]।
ध्यान तंत्र और Self‑Attention
ध्यान तंत्र Value वेक्टरों का भारित योग परिकलित करता है, जहाँ भार Key और Query की परस्पर संगतता की मात्रा से निर्धारित होते हैं। Transformer में Scaled Dot‑Product Attention का उपयोग किया जाता है:
जहाँ Key/Query की विमा है; से भाग करने पर softmax की संतृप्ति (saturation) रोकी जाती है[1]। जब , और एक ही अनुक्रम से उत्पन्न होते हैं, तो इस तंत्र को Self‑Attention कहा जाता है।
Multi‑Head Attention - बहु-शीर्ष ध्यान
एक ही मैट्रिक्स सेट के बजाय समानांतर «शीर्षों» (heads) का उपयोग किया जाता है, जिनमें से प्रत्येक को छोटे आयाम के उप-स्थानों में प्रक्षेपित करता है, स्वतंत्र रूप से attention परिकलित करता है, फिर परिणाम संयोजित (concatenate) होकर प्रक्षेपित किए जाते हैं[1]:
इनफरेंस को गति देने के लिए भिन्न रूप:
- MQA (Multi‑Query Attention): सभी heads एक ही Key/Value साझा करते हैं → डिकोडिंग के समय KV‑cache का आयतन और ट्रैफिक उल्लेखनीय रूप से घटता है[4]।
- GQA (Grouped‑Query Attention): MHA और MQA के बीच समझौता — कई Head समूह K/V साझा करते हैं; गुणवत्ता MHA के निकट और गति MQA के समान[5]।
Positional Encoding - स्थानीय कूटांकन
चूँकि Self-Attention token के क्रम के प्रति अपरिवर्तनीय है, इसलिए इनपुट embedding में Positional Encoding जोड़े जाते हैं।
- [1] से मूल Sinusoidal Encoding (PE):
- आधुनिक सापेक्ष/घूर्णी (Rotary) भिन्नताएँ:
Position-wise FFN, Residuals और Normalization
एन्कोडर और डिकोडर की प्रत्येक परत में ध्यान के अतिरिक्त Position-wise FFN होती है:
प्रत्येक उप-परत के चारों ओर Residual Connections और Layer Normalization उपयोग की जाती है: । मूल शोधपत्र में Post‑LN का उपयोग था[1]; आधुनिक LLM में बेहतर प्रशिक्षण स्थिरता और warm‑up पर कम निर्भरता के लिए अक्सर Pre‑LN उपयोग किया जाता है[3]।
विकास और आधुनिक भिन्नताएँ
RNN और उनके उन्नत संस्करणों जैसे LSTM पर आधारित प्रारंभिक विधियाँ पाठ को अनुक्रमिक रूप से, एक समय में एक token संसाधित करती थीं। यद्यपि यह दृष्टिकोण भाषा की संरचना के अनुरूप सहज प्रतीत होता था, किंतु इसने एक महत्वपूर्ण सीमा उत्पन्न की: इसने समानांतर परिकलन को कठिन बनाया और पाठ में एक-दूसरे से दूर स्थित तत्वों के बीच निर्भरताओं की पहचान जटिल बना दी। 2017 में Google के शोधकर्ताओं के एक समूह ने «Attention Is All You Need» शीर्षक का शोधपत्र प्रस्तुत किया। इसमें उन्होंने एक नई आर्किटेक्चर — «Transformer» — का वर्णन किया। इस मॉडल ने पहली बार Recurrent Neural Networks का उपयोग पूरी तरह से छोड़ दिया और उन्हें «Attention» तंत्र से प्रतिस्थापित किया। मुख्य नवीनता यह थी कि Attention तंत्र ने Transformer को इनपुट अनुक्रम में प्रत्येक शब्द के महत्व का मूल्यांकन करने की अनुमति दी — आउटपुट में संगत शब्द उत्पन्न करने के लिए। साथ ही मॉडल सभी शब्दों को एक साथ संसाधित कर सकता था। समानांतर प्रसंस्करण की यह क्षमता विशाल डेटा पर बहुत बड़े मॉडलों के प्रशिक्षण को संभव बनाती है। इसके परिणामस्वरूप आधुनिक Large Language Models (LLM) का उदय हुआ।
Transformer आर्किटेक्चर ने अनेक मॉडलों की आधारशिला रखी, जिन्हें मोटे तौर पर तीन वर्गों में विभाजित किया जा सकता है।
1. Encoder-only - केवल-एन्कोडर मॉडल
- उदाहरण: BERT (और RoBERTa, ALBERT)[8]।
- सिद्धांत: द्विदिशीय (bidirectional) संदर्भ के साथ Masked Language Modeling (MLM) कार्य पर पूर्व-प्रशिक्षण।
- अनुप्रयोग: समझ आधारित कार्य (वर्गीकरण, NER आदि)।
2. Decoder-only - केवल-डिकोडर मॉडल
- उदाहरण: GPT श्रृंखला (GPT‑1/2/3)[9][10], LLaMA[11], Claude।
- सिद्धांत: Causal Language Modeling (CLM) — अगले token की भविष्यवाणी; attention पर causal mask लगाया जाता है[1]।
- अनुप्रयोग: पाठ निर्माण, संवाद, कोड।
3. Encoder-decoder - एन्कोडर-डिकोडर मॉडल
- उदाहरण: मूल Transformer, T5, BART[1][12]।
- सिद्धांत: एन्कोडर इनपुट का प्रतिनिधित्व तैयार करता है, डिकोडर आउटपुट उत्पन्न करता है और एन्कोडर की विशेषताओं के प्रति Cross-Attention का उपयोग करता है[1]।
- अनुप्रयोग: seq2seq कार्य (अनुवाद, सारांशीकरण आदि)।
4. मल्टीमॉडल और वैकल्पिक आर्किटेक्चर
- Vision Transformer (ViT) — छवियों के लिए अनुकूलन (patches में विभाजन)[13]; Swin Transformer — shifted windows के साथ श्रेणीबद्ध मॉडल[14]।
- लंबे अनुक्रमों के लिए विकल्प:
प्रशिक्षण और अनुकूलन तकनीकें
Transformer की प्रभावशीलता प्रशिक्षण तकनीक और बुनियादी ढाँचे से घनिष्ठ रूप से जुड़ी है।
- पूर्व-प्रशिक्षण रणनीतियाँ: CLM और MLM; साथ ही contrastive और denoising उद्देश्य (ELECTRA, T5)[12]।
- Fine-tuning तकनीकें:
- सभी पैरामीटरों का पूर्ण Fine-tuning।
- Parameter-Efficient Fine-Tuning (PEFT): LoRA आधारभूत भार जमे रखते हुए low-rank adapters जोड़ता है[18]।
- व्यवहार संरेखण (Alignment): RLHF — मानव प्रतिक्रिया पर आधारित Reinforcement Learning[19]।
- इनफरेंस के लिए सिस्टम अनुकूलन: PagedAttention/vLLM KV‑cache के पेज-आधारित प्रबंधन से सर्विंग थ्रूपुट बढ़ाता है; लंबे अनुक्रमों और बड़े batches के लिए विशेष रूप से उपयोगी[20]।
संदर्भ
- The Illustrated Transformer — Transformer आर्किटेक्चर की दृश्य व्याख्या
साहित्य
- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). Improving Language Understanding by Generative Pre‑Training. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language Models Are Few‑Shot Learners. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). Efficient Transformers: A Survey. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). On Layer Normalization in the Transformer Architecture. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). RoFormer: Rotary Position Embedding. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). Train Short, Test Long: Attention with Linear Biases (ALiBi). arXiv:2108.12409.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Peng, B., et al. (2023). RWKV: Reinventing RNNs for the Transformer Era. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. OpenReview.
टिप्पणियाँ
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762.
- ↑ Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). Efficient Transformers: A Survey. arXiv:2009.06732.
- ↑ 3.0 3.1 Xiong, R., Yang, Y., He, D., et al. (2020). On Layer Normalization in the Transformer Architecture. ICML. arXiv:2002.04745.
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.
- ↑ Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. EMNLP. arXiv:2305.13245.
- ↑ Su, J., Lu, Y., Pan, S., et al. (2021). RoFormer: Rotary Position Embedding. arXiv:2104.09864.
- ↑ Press, O., Smith, N. A., Lewis, M. (2021). Train Short, Test Long: Attention with Linear Biases (ALiBi). arXiv:2108.12409.
- ↑ Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- ↑ Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). Improving Language Understanding by Generative Pre‑Training. OpenAI.
- ↑ Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language Models Are Few‑Shot Learners. NeurIPS. arXiv:2005.14165.
- ↑ Touvron, H., Lavril, T., Izacard, G., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- ↑ 12.0 12.1 Raffel, C., Shazeer, N., Roberts, A., et al. (2019). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. JMLR. arXiv:1910.10683.
- ↑ Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. ICLR. arXiv:2010.11929.
- ↑ Liu, Z., Lin, Y., Cao, Y., et al. (2021). Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. ICCV. arXiv:2103.14030.
- ↑ Gu, A., Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- ↑ Peng, B., et al. (2023). RWKV: Reinventing RNNs for the Transformer Era. arXiv:2305.13048.
- ↑ Lieber, O., Lenz, B., Bata, H., et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- ↑ Hu, E. J., Shen, Y., Wallis, P., et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685.
- ↑ Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. OpenReview.
- ↑ Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. arXiv:2309.06180.