Encoder-only models — শুধুমাত্র এনকোডার আর্কিটেকচার
শুধুমাত্র-এনকোডার মডেল (ইংরেজি: Encoder-Only Models) — এটি বৃহৎ ভাষা মডেলের (LLM) আর্কিটেকচারের একটি শ্রেণি, যা Transformer আর্কিটেকচারের শুধুমাত্র এনকোডিং অংশের (এনকোডার) উপর ভিত্তি করে গড়ে উঠেছে। ডিকোডার বা সম্পূর্ণ এনকোডার-ডিকোডার আর্কিটেকচার ব্যবহারকারী মডেলগুলির বিপরীতে, এই মডেলগুলি প্রাকৃতিক ভাষা বোঝার (Natural Language Understanding, NLU) কাজে বিশেষজ্ঞ।
এই পদ্ধতির পথিকৃৎ এবং প্রধান মডেল হল BERT (Bidirectional Encoder Representations from Transformers), যা ২০১৮ সালে Google তৈরি করেছিল।
ধারণা এবং আর্কিটেকচার
শুধুমাত্র-এনকোডার মডেলগুলির মূল ধারণা হল ইনপুট সিকোয়েন্সের প্রতিটি token-এর জন্য গভীর, প্রাসঙ্গিক উপস্থাপনা (embedding) তৈরি করা। Transformer-এর self-attention প্রক্রিয়ার মাধ্যমে প্রতিটি token সিকোয়েন্সের অন্য সব token-এর সাথে «দেখতে» এবং মিথস্ক্রিয়া করতে পারে, যা মডেলকে সমৃদ্ধ প্রসঙ্গ ধারণ করতে সক্ষম করে।
একটি মূল বৈশিষ্ট্য হল দ্বিমুখীতা: প্রতিটি token-এর উপস্থাপনা একই সাথে বাম এবং ডান উভয় প্রসঙ্গের উপর ভিত্তি করে গঠিত হয়। এটি তাদেরকে শুধুমাত্র-ডিকোডার অটোরিগ্রেসিভ মডেল (যেমন GPT) থেকে মৌলিকভাবে আলাদা করে, যেগুলি স্বভাবতই একমুখী।
আর্কিটেকচারগতভাবে, মডেলটি টি অভিন্ন এনকোডার স্তরের একটি স্তূপ নিয়ে গঠিত। প্রতিটি স্তর দুটি প্রধান উপ-স্তর নিয়ে তৈরি:
- বহু-মাথার self-attention (Multi-Head Self-Attention): প্রতিটি token-এর জন্য প্রাসঙ্গিক উপস্থাপনা গণনা করে।
- পূর্ণ-সংযুক্ত নিউরাল নেটওয়ার্ক (Feed-Forward Network): প্রতিটি token-এর উপস্থাপনায় অরৈখিক রূপান্তর প্রয়োগ করে।
আউটপুটে মডেলটি ইনপুট সিকোয়েন্সের সমান দৈর্ঘ্যের একটি ভেক্টর সিকোয়েন্স তৈরি করে, যেখানে প্রতিটি ভেক্টর সংশ্লিষ্ট ইনপুট token-এর একটি সমৃদ্ধ উপস্থাপনা।
প্রাক-প্রশিক্ষণের কাজসমূহ
দ্বিমুখী প্রসঙ্গে ভাষা বোঝার জন্য মডেলকে প্রশিক্ষণ দিতে বিশেষ স্ব-তত্ত্বাবধায়িত প্রাক-প্রশিক্ষণ কাজ ব্যবহার করা হয়:
মাস্কড ভাষা মডেলিং (Masked Language Modeling, MLM)
এটি শুধুমাত্র-এনকোডার মডেলগুলির জন্য সবচেয়ে গুরুত্বপূর্ণ প্রাথমিক কাজ, যা প্রথম BERT-এ উপস্থাপিত হয়েছিল।
- কার্যপদ্ধতি: ইনপুট সিকোয়েন্স থেকে এলোমেলোভাবে একটি ছোট শতাংশ token (সাধারণত ১৫%) লুকিয়ে (মাস্ক করে) দেওয়া হয়। মডেলের কাজ হল চারপাশের দ্বিমুখী প্রসঙ্গ ব্যবহার করে এই মাস্ক করা token-গুলির মূল মান অনুমান করা।
- লক্ষ্য: এই কাজটি মডেলকে শব্দের মধ্যে গভীর শব্দার্থিক ও বাক্যতাত্ত্বিক সম্পর্ক শিখতে বাধ্য করে।
পরবর্তী বাক্য পূর্বাভাস (Next Sentence Prediction, NSP)
এই কাজটি (মূল BERT থেকেও) বাক্যগুলির মধ্যে সম্পর্ক বোঝার জন্য মডেলকে প্রশিক্ষণ দিতে তৈরি হয়েছিল।
- কার্যপদ্ধতি: মডেলকে একজোড়া বাক্য দেওয়া হয় এবং এটি নির্ধারণ করতে হয় যে দ্বিতীয় বাক্যটি মূল পাঠ্যে প্রথমটির যুক্তিসঙ্গত ধারাবাহিকতা কিনা।
- বর্তমান অবস্থা: পরবর্তীতে গবেষণায় (যেমন RoBERTa মডেলে) দেখা গেছে যে NSP, MLM-এর চেয়ে কম কার্যকর, এবং এটি প্রায়ই অন্য কাজ দিয়ে প্রতিস্থাপিত হয় বা সম্পূর্ণ বাদ দেওয়া হয়।
প্রয়োগ
শুধুমাত্র-এনকোডার মডেলগুলি মুক্ত আকারে পাঠ্য তৈরির জন্য উপযুক্ত নয়, কারণ তাদের অটোরিগ্রেসিভ ডিকোডার নেই। তাদের শক্তি পাঠ্য বিশ্লেষণ ও বোঝার মধ্যে। মডেলের আউটপুট ভেক্টর উপস্থাপনাগুলি বিস্তৃত NLU কাজ সমাধানে ব্যবহৃত হয়:
- পাঠ্য শ্রেণিবিভাগ: অনুভূতি বিশ্লেষণ বা বিষয় নির্ধারণের মতো কাজে, প্রতিটি সিকোয়েন্সের শুরুতে যুক্ত বিশেষ token `[CLS]`-এর উপস্থাপনা ব্যবহার করা হয়। এর চূড়ান্ত ভেক্টর পুরো সিকোয়েন্সের তথ্য একত্রিত করে।
- Token শ্রেণিবিভাগ: নামযুক্ত সত্তা স্বীকৃতি (NER) বা বাগধারার অংশ ট্যাগিং (POS-tagging)-এর মতো কাজে প্রতিটি পৃথক token-এর ভেক্টর উপস্থাপনা ব্যবহার করা হয়।
- প্রশ্নোত্তর (Question Answering): যেখানে উত্তরটি প্রদত্ত পাঠ্যের একটি অংশ (extractive QA), সেখানে মডেল উত্তরের শুরু ও শেষ token অনুমান করতে প্রশিক্ষিত হয়।
- Embedding প্রাপ্তি: এনকোডার মডেলগুলি প্রায়ই উচ্চমানের বাক্য বা দস্তাবেজের embedding পাওয়ার জন্য সার্বজনীন পাঠ্য এনকোডার হিসেবে ব্যবহৃত হয়, যা পরে অনুসন্ধান ব্যবস্থায় বা শব্দার্থিক সাদৃশ্যের কাজে ব্যবহার করা যায়।
মূল মডেল এবং তাদের বিকাশ
- BERT (২০১৮): আর্কিটেকচারের পথিকৃৎ, যা অসংখ্য NLP benchmark-এ নতুন রেকর্ড স্থাপন করেছে।
- RoBERTa (২০১৯): «দৃঢ়ভাবে অপ্টিমাইজড BERT»। দেখিয়েছে যে আরও বেশি ডেটায় দীর্ঘ প্রশিক্ষণ এবং NSP কাজ বাদ দিলে BERT-এর কার্যকারিতা উল্লেখযোগ্যভাবে উন্নত করা যায়।
- ALBERT (২০১৯): «A Lite BERT»। embedding ফ্যাক্টরাইজেশন এবং আন্তঃস্তর প্যারামিটার ভাগাভাগির কৌশলের মাধ্যমে উল্লেখযোগ্যভাবে কম প্যারামিটারের একটি মডেল।
- DistilBERT (২০১৯): জ্ঞান পাতন (knowledge distillation) ব্যবহার করে তৈরি BERT-এর একটি ছোট সংস্করণ, যা দ্রুততর ও হালকা কিন্তু মূলের বেশিরভাগ কার্যকারিতা ধরে রাখে।
- ELECTRA (২০২০): আরও কার্যকর প্রাক-প্রশিক্ষণ কাজ উপস্থাপন করেছে — replaced token detection, যেখানে মডেল শেখে মূল token এবং একটি ছোট জেনারেটর মডেল দ্বারা তৈরি «নকল» token-এর মধ্যে পার্থক্য করতে।
- DeBERTa (২০২০): «বিচ্ছিন্ন attention» (disentangled attention) প্রক্রিয়া প্রবর্তন করেছে, যা token-এর বিষয়বস্তু এবং আপেক্ষিক অবস্থান আলাদাভাবে এনকোড করে।
আরও দেখুন
- BERT