Transformer architecture — ٹرانسفارمر آرکیٹیکچر
Transformer آرکیٹیکچر — یہ ایک neural network آرکیٹیکچر ہے جسے 2017 میں Google کے محققین نے «Attention Is All You Need» مقالے میں پیش کیا[1]۔ اس نے قدرتی زبان کی پروسیسنگ (NLP) کے شعبے میں انقلاب برپا کیا اور BERT، GPT اور Gemini جیسے زیادہ تر جدید بڑے زبانی ماڈلز (LLM) کی بنیاد بنا۔ Transformer کی کلیدی اختراع خود-توجہ (self‑attention) کا طریقہ کار ہے، جو ماڈل کو ان پٹ ڈیٹا کے مختلف حصوں کی اہمیت کو وزن دینے اور سیکوینسز کو متوازی طور پر پروسیس کرنے کی صلاحیت دیتا ہے، اور RNN اور LSTM میں موجود تکراریت سے چھٹکارا دلاتا ہے۔
تاریخی سیاق و سباق اور پس منظر
2017 سے پہلے، متن جیسے تسلسلی ڈیٹا کی پروسیسنگ کے لیے غالب آرکیٹیکچر تکراری neural networks (RNN) اور ان کا بہتر ورژن — طویل قلیل مدتی یادداشت والے نیٹ ورکس (LSTM) تھے۔
RNN/LSTM کے وہ مسائل جن کو Transformer نے حل کیا
- تسلسلی پروسیسنگ کی حدود: RNN اور LSTM ڈیٹا کو token بہ token پروسیس کرتے ہیں، جس سے سیکوینس کے اندر متوازی پروسیسنگ ناممکن ہو جاتی ہے اور بڑے ڈیٹا پر تربیت سست پڑ جاتی ہے۔
- غائب اور پھٹتے gradients کا مسئلہ: لمبے سیکوینسز میں، متعدد مراحل سے پیچھے کی جانب پھیلنے والے gradients یا تو ختم ہو سکتے ہیں یا بڑھ سکتے ہیں، جس سے طویل مدتی انحصار سیکھنا مشکل ہو جاتا ہے۔
- طویل مدتی انحصار: سیکوینس کے آغاز کی معلومات اس کے اختتام تک ضائع ہو سکتی ہے۔
Transformer کا طریقہ کار توجہ کے طریقہ کار کے حق میں تکراریت سے مکمل دستبرداری ہے۔ یہ کسی بھی دو پوزیشنز کے درمیان انحصار کی مستقل راستے کی لمبائی () فراہم کرتا ہے، جو دور کے انحصار کی ماڈلنگ آسان بناتا ہے، جبکہ self-attention کے بنیادی نفاذ میں سیکوینس کی لمبائی کے لحاظ سے مربعی حسابی پیچیدگی ہوتی ہے ()[1][2]۔ gradients کے ختم ہونے/پھٹنے کا مسئلہ «ختم» نہیں ہوتا، بلکہ residual connections، LayerNorm اور تربیتی طریقہ کار کے ذریعے نرم کیا جاتا ہے؛ جدید نفاذ میں اکثر Pre‑LayerNorm (Pre‑LN) کا ورژن استعمال ہوتا ہے جو تربیت میں زیادہ مستحکم ہے[3]۔
آرکیٹیکچر اور کلیدی اجزاء
Transformer کا اصل آرکیٹیکچر دو بنیادی حصوں پر مشتمل ہے: encoder اور decoder۔ دونوں اجزاء یکساں تہوں کے stack ہیں (اصل مقالے میں )[1]۔
- Encoder تہ کی ساخت: (1) کثیر سری خود-توجہ (MHA)، (2) پوزیشنی-عنصری FFN؛ ہر ذیلی تہ residual connection اور LayerNorm سے گھری ہوئی ہے[1]۔
- Decoder تہ کی ساخت: (1) ماسک شدہ خود-توجہ (causal mask آنے والی پوزیشنز تک رسائی روکتی ہے)، (2) encoder کے آؤٹ پٹس کی جانب cross‑attention، (3) FFN — residuals اور LayerNorm کے ساتھ[1]۔
توجہ کا طریقہ کار اور Self‑Attention
توجہ کا طریقہ کار Value vectors کا وزنی مجموعہ حساب کرتا ہے، جہاں وزن Query کے ساتھ Key کی مطابقت کی ڈگری سے طے ہوتے ہیں۔ Transformer میں scaled dot‑product attention استعمال ہوتا ہے:
جہاں keys/queries کی جہت ہے؛ سے تقسیم softmax کی سیری کو روکتی ہے[1]۔ جب ، اور ایک ہی سیکوینس سے پیدا ہوتے ہیں، تو اس طریقہ کار کو خود-توجہ (self‑attention) کہتے ہیں۔
Multi‑Head Attention - کثیر سری توجہ
ماترکسز کے ایک سیٹ کی بجائے متوازی «heads» استعمال ہوتے ہیں، جن میں سے ہر ایک کو چھوٹی جہت والے ذیلی فضاوں میں project کرتا ہے، آزادانہ توجہ حساب کرتا ہے، پھر نتائج کو یکجا کر کے project کیا جاتا ہے[1]:
inference کو تیز کرنے کے لیے ورژنز:
- MQA (Multi‑Query Attention): تمام heads ایک key/value شیئر کرتے ہیں → decoding کے دوران KV‑cache کا حجم اور ٹریفک نمایاں طور پر کم ہوتا ہے[4]۔
- GQA (Grouped‑Query Attention): MHA اور MQA کے درمیان سمجھوتہ — heads کے کئی گروپ K/V شیئر کرتے ہیں؛ معیار MQA کی رفتار پر MHA کے قریب ہے[5]۔
Positional Encoding - پوزیشنی کوڈنگ
چونکہ self-attention tokens کی ترتیب سے بے نیاز ہے، اس لیے ان پٹ embeddings میں پوزیشنی کوڈنگ شامل کی جاتی ہے۔
- اصل sinusoidal کوڈنگ (PE) از[1]:
- جدید relative/rotary ورژنز:
عنصری FFN، residuals اور normalization
encoder اور decoder کی ہر تہ، توجہ کے علاوہ، پوزیشنی-عنصری FFN پر مشتمل ہے:
ہر ذیلی تہ کے گرد residual connections اور Layer Normalization استعمال ہوتی ہے: ۔ اصل میں Post‑LN ورژن استعمال ہوتا تھا[1]؛ جدید LLM میں اکثر بہتر تربیتی استحکام اور warm‑up پر کم انحصار کے لیے Pre‑LN استعمال ہوتا ہے[3]۔
ارتقاء اور جدید ورژنز
تکراری neural networks (RNN) اور ان کے ترقی یافتہ ورژنز جیسے LSTM پر مبنی ابتدائی طریقے متن کو یکے بعد دیگرے، ایک وقت میں ایک token کے حساب سے پروسیس کرتے تھے۔ اگرچہ یہ طریقہ زبان کی ساخت کے ساتھ بدیہی طور پر ہم آہنگ تھا، لیکن اس نے ایک اہم حد پیدا کی: متوازی حسابات مشکل ہو گئے اور متن میں دور دور موجود عناصر کے درمیان انحصار تلاش کرنا پیچیدہ ہو گیا۔ 2017 میں Google کے محققین کے ایک گروپ نے «Attention Is All You Need» کے عنوان سے ایک مقالہ پیش کیا۔ اس میں انہوں نے ایک نئے آرکیٹیکچر — «Transformer» — کی وضاحت کی۔ اس ماڈل نے پہلی بار تکراری neural networks کا استعمال مکمل طور پر ترک کر کے انہیں توجہ (attention) کے طریقہ کار سے بدل دیا۔ بنیادی نئی بات یہ تھی کہ توجہ کا طریقہ کار Transformer کو آؤٹ پٹ میں متعلقہ لفظ پیدا کرنے کے لیے ان پٹ سیکوینس میں ہر لفظ کی اہمیت جانچنے دیتا تھا۔ اس کے ساتھ ماڈل تمام الفاظ کو بیک وقت پروسیس کر سکتا تھا۔ متوازی پروسیسنگ کی اس صلاحیت نے ڈیٹا کی بہت بڑی مقدار پر کہیں زیادہ بڑے ماڈلز کی تربیت ممکن بنائی۔ نتیجتاً جدید بڑے زبانی ماڈلز (LLM) وجود میں آئے۔
Transformer آرکیٹیکچر نے بہت سے ماڈلز کی بنیاد فراہم کی، جو تین کلاسوں میں تقسیم ہوتے ہیں۔
1. صرف‑encoder ماڈلز (Encoder‑only)
- مثال: BERT (اور RoBERTa، ALBERT)[8]۔
- اصول: دو طرفہ سیاق کے ساتھ ماسک شدہ زبانی ماڈلنگ (MLM) کے کام پر پیش تربیت۔
- استعمال: سمجھ بوجھ کے کام (درجہ بندی، NER وغیرہ)۔
2. صرف‑decoder ماڈلز (Decoder‑only)
- مثال: GPT سیریز (GPT‑1/2/3)[9][10]، LLaMA[11]، Claude۔
- اصول: causal زبانی ماڈلنگ (CLM) — اگلے token کی پیش گوئی؛ توجہ پر causal mask لگائی جاتی ہے[1]۔
- استعمال: متن کی تخلیق، مکالمہ، کوڈ۔
3. encoder‑decoder ماڈلز (Encoder‑decoder)
- مثال: اصل Transformer، T5، BART[1][12]۔
- اصول: encoder ان پٹ کی نمائندگی بناتا ہے، decoder آؤٹ پٹ تیار کرتا ہے اور encoder کی خصوصیات کی جانب cross‑attention استعمال کرتا ہے[1]۔
- استعمال: seq2seq کام (ترجمہ، خلاصہ سازی وغیرہ)۔
4. ملٹی موڈل اور متبادل آرکیٹیکچرز
- Vision Transformer (ViT) — تصاویر کے لیے موافقت (patches میں تقسیم)[13]؛ Swin Transformer — shifted windows کے ساتھ درجہ بندی ماڈل[14]۔
- لمبے سیکوینسز پر متبادل:
تربیت اور اصلاح کی تکنیکیں
Transformer کی کارکردگی کا تربیتی تکنیک اور بنیادی ڈھانچے سے گہرا تعلق ہے۔
- پیش تربیت کی حکمت عملیاں: CLM اور MLM؛ نیز تضادی اور denoise کرنے والے اہداف (ELECTRA، T5)[12]۔
- fine‑tuning کی تکنیکیں:
- تمام parameters کا مکمل fine‑tuning۔
- Parameter‑efficient fine‑tuning (PEFT): LoRA منجمد بنیادی weights کے ساتھ low‑rank adapters متعارف کراتا ہے[18]۔
- رویے کی ہم آہنگی: RLHF — انسانی رائے کی بنیاد پر reinforcement learning[19]۔
- Inference کی نظامی اصلاحات: PagedAttention/vLLM KV‑cache کے صفحاتی انتظام کے ذریعے serving کی throughput بڑھاتے ہیں؛ لمبے سیکوینسز اور بڑے batches کے لیے خاص طور پر مفید ہے[20]۔
حوالہ جات
- The Illustrated Transformer — Transformer آرکیٹیکچر کی بصری وضاحت
کتابیات
- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). Improving Language Understanding by Generative Pre‑Training. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language Models Are Few‑Shot Learners. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). Efficient Transformers: A Survey. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). On Layer Normalization in the Transformer Architecture. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). RoFormer: Rotary Position Embedding. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). Train Short, Test Long: Attention with Linear Biases (ALiBi). arXiv:2108.12409.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Peng, B., et al. (2023). RWKV: Reinventing RNNs for the Transformer Era. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. OpenReview.
حواشی
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762.
- ↑ Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). Efficient Transformers: A Survey. arXiv:2009.06732.
- ↑ 3.0 3.1 Xiong, R., Yang, Y., He, D., et al. (2020). On Layer Normalization in the Transformer Architecture. ICML. arXiv:2002.04745.
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.
- ↑ Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. EMNLP. arXiv:2305.13245.
- ↑ Su, J., Lu, Y., Pan, S., et al. (2021). RoFormer: Rotary Position Embedding. arXiv:2104.09864.
- ↑ Press, O., Smith, N. A., Lewis, M. (2021). Train Short, Test Long: Attention with Linear Biases (ALiBi). arXiv:2108.12409.
- ↑ Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- ↑ Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). Improving Language Understanding by Generative Pre‑Training. OpenAI.
- ↑ Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language Models Are Few‑Shot Learners. NeurIPS. arXiv:2005.14165.
- ↑ Touvron, H., Lavril, T., Izacard, G., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- ↑ 12.0 12.1 Raffel, C., Shazeer, N., Roberts, A., et al. (2019). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. JMLR. arXiv:1910.10683.
- ↑ Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. ICLR. arXiv:2010.11929.
- ↑ Liu, Z., Lin, Y., Cao, Y., et al. (2021). Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. ICCV. arXiv:2103.14030.
- ↑ Gu, A., Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- ↑ Peng, B., et al. (2023). RWKV: Reinventing RNNs for the Transformer Era. arXiv:2305.13048.
- ↑ Lieber, O., Lenz, B., Bata, H., et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- ↑ Hu, E. J., Shen, Y., Wallis, P., et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685.
- ↑ Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. OpenReview.
- ↑ Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. arXiv:2309.06180.