Transformer architecture — ট্রান্সফর্মার
Transformer আর্কিটেকচার — এটি একটি Neural Network আর্কিটেকচার, যা ২০১৭ সালে Google-এর গবেষকরা «Attention Is All You Need» শিরোনামের গবেষণাপত্রে উপস্থাপন করেন[1]। এটি প্রাকৃতিক ভাষা প্রক্রিয়াকরণ (NLP) ক্ষেত্রে বিপ্লব এনেছে এবং BERT, GPT ও Gemini-এর মতো অধিকাংশ আধুনিক বৃহৎ ভাষা মডেল (LLM)-এর ভিত্তি হয়ে উঠেছে। Transformer-এর মূল উদ্ভাবন হলো self‑attention (স্ব-মনোযোগ) প্রক্রিয়া, যা মডেলটিকে ইনপুট ডেটার বিভিন্ন অংশের গুরুত্ব নির্ধারণ করতে এবং ক্রমগুলি সমান্তরালভাবে প্রক্রিয়া করতে সক্ষম করে, RNN ও LSTM-এর পুনরাবৃত্তিমূলক বৈশিষ্ট্য ত্যাগ করে।
ঐতিহাসিক প্রেক্ষাপট ও পূর্বশর্ত
২০১৭ সালের আগে, পাঠ্যের মতো ক্রমিক ডেটা প্রক্রিয়াকরণের জন্য আধিপত্যকারী আর্কিটেকচারগুলি ছিল পুনরাবৃত্তিমূলক Neural Network (RNN) এবং এর উন্নত রূপ — দীর্ঘ স্বল্পমেয়াদী স্মৃতি নেটওয়ার্ক (LSTM)।
RNN/LSTM-এর সমস্যা যা Transformer সমাধান করেছে
- ক্রমিক প্রক্রিয়াকরণের সীমাবদ্ধতা: RNN ও LSTM ডেটা token-এর পর token প্রক্রিয়া করে, যা ক্রম-অভ্যন্তরীণ সমান্তরালতা বাদ দেয় এবং বড় পরিমাণ ডেটায় প্রশিক্ষণ ধীর করে।
- অদৃশ্য ও বিস্ফোরণশীল gradient-এর সমস্যা: দীর্ঘ ক্রমে অনেক ধাপের মধ্য দিয়ে পেছনের দিকে প্রচারিত gradient হয় ক্ষয় পেতে পারে অথবা বাড়তে পারে, যা দীর্ঘমেয়াদী নির্ভরতার প্রশিক্ষণকে কঠিন করে।
- দীর্ঘমেয়াদী নির্ভরতা: ক্রমের শুরুর তথ্য শেষ পর্যন্ত হারিয়ে যেতে পারে।
Transformer পদ্ধতি হলো attention প্রক্রিয়ার পক্ষে পুনরাবৃত্তি থেকে সম্পূর্ণ বিরতি। এটি যেকোনো অবস্থানের মধ্যে ধ্রুবক দৈর্ঘ্যের নির্ভরতার পথ নিশ্চিত করে (), যা দূরবর্তী নির্ভরতার মডেলিং সহজ করে, যদিও self-attention-এর মৌলিক বাস্তবায়নের ক্রম দৈর্ঘ্যের উপর চতুর্ঘাতীয় গণনামূলক জটিলতা রয়েছে ()[1][2]। gradient ক্ষয়/বিস্ফোরণের সমস্যা «অদৃশ্য» হয় না, বরং residual সংযোগ, LayerNorm এবং প্রশিক্ষণ মোডের মাধ্যমে প্রশমিত হয়; আধুনিক বাস্তবায়নে প্রায়ই Pre‑LayerNorm (Pre‑LN) রূপান্তর ব্যবহার করা হয় যা প্রশিক্ষণে আরো স্থিতিশীল[3]।
আর্কিটেকচার ও মূল উপাদান
মূল Transformer আর্কিটেকচার দুটি প্রধান অংশ নিয়ে গঠিত: এনকোডার এবং ডিকোডার। উভয় উপাদানই অভিন্ন স্তরের স্তূপ (মূল গবেষণাপত্রে )[1]।
- এনকোডার স্তরের কাঠামো: (১) Multi-Head Attention (MHA), (২) অবস্থান-উপাদানভিত্তিক FFN; প্রতিটি উপ-স্তর residual সংযোগ ও LayerNorm দ্বারা ঘেরা[1]।
- ডিকোডার স্তরের কাঠামো: (১) মাস্কড self-attention (কারণগত মাস্ক ভবিষ্যৎ অবস্থানে প্রবেশ নিষিদ্ধ করে), (২) এনকোডার আউটপুটের সাথে cross‑attention, (৩) FFN — এছাড়াও residual ও LayerNorm সহ[1]।
Attention প্রক্রিয়া ও Self‑Attention
Attention প্রক্রিয়া Value ভেক্টরের ভারিত সমষ্টি গণনা করে, যেখানে ভার Query-এর সাথে Key-এর সামঞ্জস্যতার মাত্রা দ্বারা নির্ধারিত হয়। Transformer-এ স্কেলড ডট-প্রোডাক্ট Attention (Scaled Dot‑Product Attention) ব্যবহার করা হয়:
যেখানে হলো Key/Query-এর মাত্রা; দিয়ে ভাগ করা softmax-এর স্যাচুরেশন প্রতিরোধ করে[1]। যখন , ও একই ক্রম থেকে উৎপন্ন হয়, তখন প্রক্রিয়াটিকে self‑attention (স্ব-মনোযোগ) বলা হয়।
Multi‑Head Attention (বহু-মস্তক মনোযোগ)
ম্যাট্রিক্সের একটি সেটের পরিবর্তে টি সমান্তরাল «মস্তক» ব্যবহার করা হয়, যার প্রতিটি -কে ছোট মাত্রার উপ-স্থানে প্রজেক্ট করে, স্বাধীনভাবে attention গণনা করে, তারপর ফলাফলগুলি concatenate করে প্রজেক্ট করা হয়[1]:
দ্রুত inference-এর জন্য রূপান্তরসমূহ:
- MQA (Multi‑Query Attention): সব মস্তক একটি Key/Value ভাগ করে → ডিকোডিংয়ের সময় KV-ক্যাশের আয়তন ও ট্র্যাফিক উল্লেখযোগ্যভাবে হ্রাস পায়[4]।
- GQA (Grouped‑Query Attention): MHA ও MQA-এর মধ্যে আপোস — মস্তকের কয়েকটি গ্রুপ K/V ভাগ করে; MQA-এর গতিতে MHA-এর কাছাকাছি মান[5]।
অবস্থানগত এনকোডিং (Positional Encoding)
যেহেতু self-attention token-এর ক্রমের প্রতি অপরিবর্তনীয়, তাই ইনপুট embedding-এ অবস্থানগত কোডিং যোগ করা হয়।
- [1] থেকে মূল সাইনুসয়েডাল কোডিং (PE):
- আধুনিক আপেক্ষিক/ঘূর্ণনমূলক রূপান্তর:
উপাদানভিত্তিক FFN, Residual সংযোগ ও নর্মালাইজেশন
এনকোডার ও ডিকোডারের প্রতিটি স্তরে attention ছাড়াও একটি অবস্থান-উপাদানভিত্তিক FFN রয়েছে:
প্রতিটি উপ-স্তরের চারপাশে অবশিষ্ট সংযোগ (residual connections) ও Layer Normalization ব্যবহার করা হয়: । মূল গবেষণাপত্রে Post‑LN রূপান্তর ব্যবহার করা হয়েছিল[1]; আধুনিক LLM-এ প্রায়ই Pre‑LN ব্যবহার করা হয় প্রশিক্ষণের ভালো স্থিতিশীলতা ও দীর্ঘ warm‑up-এর উপর কম নির্ভরতার জন্য[3]।
বিবর্তন ও আধুনিক রূপান্তর
RNN এবং LSTM-এর মতো এর উন্নত রূপের উপর ভিত্তি করে প্রাথমিক পদ্ধতিগুলি পাঠ্য ক্রমানুসারে, এক সময়ে একটি token প্রক্রিয়া করত। যদিও এই পদ্ধতিটি স্বজ্ঞাতভাবে ভাষার কাঠামোর সাথে সামঞ্জস্যপূর্ণ ছিল, তবুও এটি একটি উল্লেখযোগ্য সীমাবদ্ধতা তৈরি করেছিল: সমান্তরাল গণনা কঠিন করে তুলেছিল এবং পাঠ্যে একে অপরের থেকে দূরে অবস্থিত উপাদানগুলির মধ্যে নির্ভরতা সনাক্ত করা জটিল করে তুলেছিল। ২০১৭ সালে Google-এর একদল গবেষক «Attention Is All You Need» শিরোনামের একটি গবেষণাপত্র উপস্থাপন করেন। সেখানে তারা একটি নতুন আর্কিটেকচার — «Transformer» বর্ণনা করেন। এই মডেলটি প্রথমবারের মতো সম্পূর্ণরূপে পুনরাবৃত্তিমূলক Neural Network ব্যবহার ত্যাগ করে, সেগুলিকে «attention» (মনোযোগ) প্রক্রিয়া দিয়ে প্রতিস্থাপন করে। মূল উদ্ভাবন ছিল যে attention প্রক্রিয়া Transformer-কে আউটপুটে সংশ্লিষ্ট শব্দ তৈরির জন্য ইনপুট ক্রমের প্রতিটি শব্দের গুরুত্ব মূল্যায়ন করতে সক্ষম করেছিল। একই সাথে মডেলটি সব শব্দ একসাথে প্রক্রিয়া করতে পারত। সমান্তরাল প্রক্রিয়াকরণের এই ক্ষমতা বিশাল পরিমাণ ডেটায় অনেক বড় মডেল প্রশিক্ষণ সম্ভব করে তুলেছিল। ফলে আধুনিক বৃহৎ ভাষা মডেল (LLM) আবির্ভূত হয়েছে।
Transformer আর্কিটেকচার অসংখ্য মডেলের ভিত্তি হয়েছে, যেগুলিকে আনুমানিকভাবে তিনটি শ্রেণিতে ভাগ করা যায়।
১. শুধুমাত্র-এনকোডার মডেল (Encoder‑only)
- উদাহরণ: BERT (এবং RoBERTa, ALBERT)[8]।
- নীতি: দ্বিমুখী প্রসঙ্গ সহ মাস্কড ভাষা মডেলিং (MLM) কাজে পূর্ব-প্রশিক্ষণ।
- প্রয়োগ: বোঝার কাজ (শ্রেণীবিভাগ, NER ইত্যাদি)।
২. শুধুমাত্র-ডিকোডার মডেল (Decoder‑only)
- উদাহরণ: GPT সিরিজ (GPT‑1/2/3)[9][10], LLaMA[11], Claude।
- নীতি: কারণগত ভাষা মডেলিং (CLM) — পরবর্তী token পূর্বানুমান; attention-এ কারণগত মাস্ক আরোপ করা হয়[1]।
- প্রয়োগ: পাঠ্য তৈরি, সংলাপ, কোড।
৩. এনকোডার-ডিকোডার মডেল (Encoder‑decoder)
- উদাহরণ: মূল Transformer, T5, BART[1][12]।
- নীতি: এনকোডার ইনপুটের প্রতিনিধিত্ব তৈরি করে, ডিকোডার আউটপুট তৈরি করে এবং এনকোডারের বৈশিষ্ট্যের সাথে cross-attention ব্যবহার করে[1]।
- প্রয়োগ: seq2seq কাজ (অনুবাদ, সারসংক্ষেপ ইত্যাদি)।
৪. মাল্টিমোডাল ও বিকল্প আর্কিটেকচার
- Vision Transformer (ViT) — চিত্রের সাথে অভিযোজন (প্যাচে বিভাজন)[13]; Swin Transformer — shifted windows সহ শ্রেণিবদ্ধ মডেল[14]।
- দীর্ঘ ক্রমের জন্য বিকল্পসমূহ:
প্রশিক্ষণ ও অপ্টিমাইজেশন কৌশল
Transformer-এর কার্যকারিতা প্রশিক্ষণ কৌশল ও পরিকাঠামোর সাথে ঘনিষ্ঠভাবে সম্পর্কিত।
- পূর্ব-প্রশিক্ষণ কৌশল: CLM ও MLM; এছাড়াও contrastive ও denoising লক্ষ্য (ELECTRA, T5)[12]।
- Fine‑tuning কৌশল:
- সমস্ত প্যারামিটারের সম্পূর্ণ fine‑tuning।
- প্যারামিটার-দক্ষ fine‑tuning (PEFT): LoRA হিমায়িত মূল ওজন সহ নিম্ন-মান adapter প্রবর্তন করে[18]।
- আচরণ সংযোজন: RLHF — মানুষের প্রতিক্রিয়ার উপর ভিত্তি করে Reinforcement Learning[19]।
- Inference-এর সিস্টেম অপ্টিমাইজেশন: PagedAttention/vLLM KV-ক্যাশের পেজভিত্তিক ব্যবস্থাপনার মাধ্যমে সার্ভিংয়ের থ্রুপুট বাড়ায়; দীর্ঘ ক্রম ও বড় batch-এ বিশেষভাবে কার্যকর[20]।
তথ্যসূত্র
- The Illustrated Transformer — Transformer আর্কিটেকচারের দৃশ্যমান ব্যাখ্যা
সাহিত্য
- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). Improving Language Understanding by Generative Pre‑Training. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language Models Are Few‑Shot Learners. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). Efficient Transformers: A Survey. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). On Layer Normalization in the Transformer Architecture. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). RoFormer: Rotary Position Embedding. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). Train Short, Test Long: Attention with Linear Biases (ALiBi). arXiv:2108.12409.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Peng, B., et al. (2023). RWKV: Reinventing RNNs for the Transformer Era. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. OpenReview.
টীকা
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). Attention Is All You Need. NeurIPS. arXiv:1706.03762.
- ↑ Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). Efficient Transformers: A Survey. arXiv:2009.06732.
- ↑ 3.0 3.1 Xiong, R., Yang, Y., He, D., et al. (2020). On Layer Normalization in the Transformer Architecture. ICML. arXiv:2002.04745.
- ↑ Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.
- ↑ Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. EMNLP. arXiv:2305.13245.
- ↑ Su, J., Lu, Y., Pan, S., et al. (2021). RoFormer: Rotary Position Embedding. arXiv:2104.09864.
- ↑ Press, O., Smith, N. A., Lewis, M. (2021). Train Short, Test Long: Attention with Linear Biases (ALiBi). arXiv:2108.12409.
- ↑ Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- ↑ Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). Improving Language Understanding by Generative Pre‑Training. OpenAI.
- ↑ Brown, T. B., Mann, B., Ryder, N., et al. (2020). Language Models Are Few‑Shot Learners. NeurIPS. arXiv:2005.14165.
- ↑ Touvron, H., Lavril, T., Izacard, G., et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- ↑ 12.0 12.1 Raffel, C., Shazeer, N., Roberts, A., et al. (2019). Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer. JMLR. arXiv:1910.10683.
- ↑ Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. ICLR. arXiv:2010.11929.
- ↑ Liu, Z., Lin, Y., Cao, Y., et al. (2021). Swin Transformer: Hierarchical Vision Transformer using Shifted Windows. ICCV. arXiv:2103.14030.
- ↑ Gu, A., Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- ↑ Peng, B., et al. (2023). RWKV: Reinventing RNNs for the Transformer Era. arXiv:2305.13048.
- ↑ Lieber, O., Lenz, B., Bata, H., et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- ↑ Hu, E. J., Shen, Y., Wallis, P., et al. (2021). LoRA: Low‑Rank Adaptation of Large Language Models. arXiv:2106.09685.
- ↑ Ouyang, L., Wu, J., Jiang, X., et al. (2022). Training language models to follow instructions with human feedback. OpenReview.
- ↑ Kwon, W., Li, Z., Zhuang, S., et al. (2023). Efficient Memory Management for LLM Serving with PagedAttention. arXiv:2309.06180.