---
title: "Encoder-only models — শুধুমাত্র এনকোডার আর্কিটেকচার"
source: "https://systems-analysis.info/int/Encoder-only_models_%E2%80%94_%E0%A6%B6%E0%A7%81%E0%A6%A7%E0%A7%81%E0%A6%AE%E0%A6%BE%E0%A6%A4%E0%A7%8D%E0%A6%B0_%E0%A6%8F%E0%A6%A8%E0%A6%95%E0%A7%8B%E0%A6%A1%E0%A6%BE%E0%A6%B0_%E0%A6%86%E0%A6%B0%E0%A7%8D%E0%A6%95%E0%A6%BF%E0%A6%9F%E0%A7%87%E0%A6%95%E0%A6%9A%E0%A6%BE%E0%A6%B0"
wiki: "systems-analysis.info/int"
article: "Encoder-only_models_—_শুধুমাত্র_এনকোডার_আর্কিটেকচার"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1932
wiki_created_at: 2026-09-06T22:56:13Z
wiki_modified_at: 2026-09-06T22:56:13Z
downloaded_at: 2026-09-07T22:48:33Z
---

# Encoder-only models — শুধুমাত্র এনকোডার আর্কিটেকচার

**শুধুমাত্র-এনকোডার মডেল** (ইংরেজি: Encoder-Only Models) — এটি বৃহৎ ভাষা মডেলের (LLM) আর্কিটেকচারের একটি শ্রেণি, যা **Transformer** আর্কিটেকচারের শুধুমাত্র **এনকোডিং** অংশের (এনকোডার) উপর ভিত্তি করে গড়ে উঠেছে। ডিকোডার বা সম্পূর্ণ এনকোডার-ডিকোডার আর্কিটেকচার ব্যবহারকারী মডেলগুলির বিপরীতে, এই মডেলগুলি **প্রাকৃতিক ভাষা বোঝার (Natural Language Understanding, NLU)** কাজে বিশেষজ্ঞ।

এই পদ্ধতির পথিকৃৎ এবং প্রধান মডেল হল **BERT** (Bidirectional Encoder Representations from Transformers), যা ২০১৮ সালে Google তৈরি করেছিল।

## ধারণা এবং আর্কিটেকচার

শুধুমাত্র-এনকোডার মডেলগুলির মূল ধারণা হল ইনপুট সিকোয়েন্সের প্রতিটি token-এর জন্য গভীর, **প্রাসঙ্গিক উপস্থাপনা** (embedding) তৈরি করা। Transformer-এর **self-attention** প্রক্রিয়ার মাধ্যমে প্রতিটি token সিকোয়েন্সের অন্য সব token-এর সাথে «দেখতে» এবং মিথস্ক্রিয়া করতে পারে, যা মডেলকে সমৃদ্ধ প্রসঙ্গ ধারণ করতে সক্ষম করে।

একটি মূল বৈশিষ্ট্য হল **দ্বিমুখীতা**: প্রতিটি token-এর উপস্থাপনা একই সাথে বাম এবং ডান উভয় প্রসঙ্গের উপর ভিত্তি করে গঠিত হয়। এটি তাদেরকে শুধুমাত্র-ডিকোডার অটোরিগ্রেসিভ মডেল (যেমন GPT) থেকে মৌলিকভাবে আলাদা করে, যেগুলি স্বভাবতই একমুখী।

আর্কিটেকচারগতভাবে, মডেলটি $N$টি অভিন্ন এনকোডার স্তরের একটি স্তূপ নিয়ে গঠিত। প্রতিটি স্তর দুটি প্রধান উপ-স্তর নিয়ে তৈরি:

1.  **বহু-মাথার self-attention (Multi-Head Self-Attention):** প্রতিটি token-এর জন্য প্রাসঙ্গিক উপস্থাপনা গণনা করে।
2.  **পূর্ণ-সংযুক্ত নিউরাল নেটওয়ার্ক (Feed-Forward Network):** প্রতিটি token-এর উপস্থাপনায় অরৈখিক রূপান্তর প্রয়োগ করে।

আউটপুটে মডেলটি ইনপুট সিকোয়েন্সের সমান দৈর্ঘ্যের একটি ভেক্টর সিকোয়েন্স তৈরি করে, যেখানে প্রতিটি ভেক্টর সংশ্লিষ্ট ইনপুট token-এর একটি সমৃদ্ধ উপস্থাপনা।

## প্রাক-প্রশিক্ষণের কাজসমূহ

দ্বিমুখী প্রসঙ্গে ভাষা বোঝার জন্য মডেলকে প্রশিক্ষণ দিতে বিশেষ স্ব-তত্ত্বাবধায়িত প্রাক-প্রশিক্ষণ কাজ ব্যবহার করা হয়:

### মাস্কড ভাষা মডেলিং (Masked Language Modeling, MLM)

এটি শুধুমাত্র-এনকোডার মডেলগুলির জন্য সবচেয়ে গুরুত্বপূর্ণ প্রাথমিক কাজ, যা প্রথম BERT-এ উপস্থাপিত হয়েছিল।

- **কার্যপদ্ধতি:** ইনপুট সিকোয়েন্স থেকে এলোমেলোভাবে একটি ছোট শতাংশ token (সাধারণত ১৫%) লুকিয়ে (মাস্ক করে) দেওয়া হয়। মডেলের কাজ হল চারপাশের দ্বিমুখী প্রসঙ্গ ব্যবহার করে এই মাস্ক করা token-গুলির মূল মান অনুমান করা।
- **লক্ষ্য:** এই কাজটি মডেলকে শব্দের মধ্যে গভীর শব্দার্থিক ও বাক্যতাত্ত্বিক সম্পর্ক শিখতে বাধ্য করে।

### পরবর্তী বাক্য পূর্বাভাস (Next Sentence Prediction, NSP)

এই কাজটি (মূল BERT থেকেও) বাক্যগুলির মধ্যে সম্পর্ক বোঝার জন্য মডেলকে প্রশিক্ষণ দিতে তৈরি হয়েছিল।

- **কার্যপদ্ধতি:** মডেলকে একজোড়া বাক্য দেওয়া হয় এবং এটি নির্ধারণ করতে হয় যে দ্বিতীয় বাক্যটি মূল পাঠ্যে প্রথমটির যুক্তিসঙ্গত ধারাবাহিকতা কিনা।
- **বর্তমান অবস্থা:** পরবর্তীতে গবেষণায় (যেমন RoBERTa মডেলে) দেখা গেছে যে NSP, MLM-এর চেয়ে কম কার্যকর, এবং এটি প্রায়ই অন্য কাজ দিয়ে প্রতিস্থাপিত হয় বা সম্পূর্ণ বাদ দেওয়া হয়।

## প্রয়োগ

শুধুমাত্র-এনকোডার মডেলগুলি মুক্ত আকারে পাঠ্য তৈরির জন্য উপযুক্ত নয়, কারণ তাদের অটোরিগ্রেসিভ ডিকোডার নেই। তাদের শক্তি পাঠ্য বিশ্লেষণ ও বোঝার মধ্যে। মডেলের আউটপুট ভেক্টর উপস্থাপনাগুলি বিস্তৃত NLU কাজ সমাধানে ব্যবহৃত হয়:

- **পাঠ্য শ্রেণিবিভাগ:** অনুভূতি বিশ্লেষণ বা বিষয় নির্ধারণের মতো কাজে, প্রতিটি সিকোয়েন্সের শুরুতে যুক্ত বিশেষ token \`\[CLS\]\`-এর উপস্থাপনা ব্যবহার করা হয়। এর চূড়ান্ত ভেক্টর পুরো সিকোয়েন্সের তথ্য একত্রিত করে।
- **Token শ্রেণিবিভাগ:** নামযুক্ত সত্তা স্বীকৃতি (NER) বা বাগধারার অংশ ট্যাগিং (POS-tagging)-এর মতো কাজে প্রতিটি পৃথক token-এর ভেক্টর উপস্থাপনা ব্যবহার করা হয়।
- **প্রশ্নোত্তর (Question Answering):** যেখানে উত্তরটি প্রদত্ত পাঠ্যের একটি অংশ (extractive QA), সেখানে মডেল উত্তরের শুরু ও শেষ token অনুমান করতে প্রশিক্ষিত হয়।
- **Embedding প্রাপ্তি:** এনকোডার মডেলগুলি প্রায়ই উচ্চমানের বাক্য বা দস্তাবেজের embedding পাওয়ার জন্য সার্বজনীন পাঠ্য এনকোডার হিসেবে ব্যবহৃত হয়, যা পরে অনুসন্ধান ব্যবস্থায় বা শব্দার্থিক সাদৃশ্যের কাজে ব্যবহার করা যায়।

## মূল মডেল এবং তাদের বিকাশ

- **BERT** (২০১৮): আর্কিটেকচারের পথিকৃৎ, যা অসংখ্য NLP benchmark-এ নতুন রেকর্ড স্থাপন করেছে।
- **RoBERTa** (২০১৯): «দৃঢ়ভাবে অপ্টিমাইজড BERT»। দেখিয়েছে যে আরও বেশি ডেটায় দীর্ঘ প্রশিক্ষণ এবং NSP কাজ বাদ দিলে BERT-এর কার্যকারিতা উল্লেখযোগ্যভাবে উন্নত করা যায়।
- **ALBERT** (২০১৯): «A Lite BERT»। embedding ফ্যাক্টরাইজেশন এবং আন্তঃস্তর প্যারামিটার ভাগাভাগির কৌশলের মাধ্যমে উল্লেখযোগ্যভাবে কম প্যারামিটারের একটি মডেল।
- **DistilBERT** (২০১৯): জ্ঞান পাতন (knowledge distillation) ব্যবহার করে তৈরি BERT-এর একটি ছোট সংস্করণ, যা দ্রুততর ও হালকা কিন্তু মূলের বেশিরভাগ কার্যকারিতা ধরে রাখে।
- **ELECTRA** (২০২০): আরও কার্যকর প্রাক-প্রশিক্ষণ কাজ উপস্থাপন করেছে — **replaced token detection**, যেখানে মডেল শেখে মূল token এবং একটি ছোট জেনারেটর মডেল দ্বারা তৈরি «নকল» token-এর মধ্যে পার্থক্য করতে।
- **DeBERTa** (২০২০): «বিচ্ছিন্ন attention» (disentangled attention) প্রক্রিয়া প্রবর্তন করেছে, যা token-এর বিষয়বস্তু এবং আপেক্ষিক অবস্থান আলাদাভাবে এনকোড করে।

## আরও দেখুন

- BERT
