---
title: "Decoder-only models (architecture) (BN)"
source: "https://systems-analysis.info/int/Decoder-only_models_(architecture)_(BN)"
wiki: "systems-analysis.info/int"
article: "Decoder-only_models_(architecture)_(BN)"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Large language models"
  - "Category:Machine learning"
revision_id: 1530
wiki_created_at: 2026-09-06T22:50:02Z
wiki_modified_at: 2026-09-06T22:50:02Z
downloaded_at: 2026-09-07T22:46:28Z
---

# Decoder-only models (architecture) (BN)

**শুধুমাত্র-ডিকোডার মডেল** (ইংরেজি: Decoder-Only Models) — এটি বৃহৎ ভাষা মডেলের (LLM) আর্কিটেকচারের একটি প্রভাবশালী শ্রেণি, যা সম্পূর্ণরূপে **Transformer** আর্কিটেকচারের **ডিকোডিং** অংশের (ডিকোডার) উপর ভিত্তি করে গড়ে উঠেছে। এই মডেলগুলো **টেক্সট জেনারেশন** কাজে বিশেষজ্ঞ এবং আধুনিক অধিকাংশ চ্যাটবট ও AI-অ্যাসিস্ট্যান্টের ভিত্তি হিসেবে কাজ করে।

এই পদ্ধতিকে জনপ্রিয় করে তোলা ফ্ল্যাগশিপ সিরিজটি হলো OpenAI-এর **GPT** মডেল সিরিজ।

## ধারণা ও আর্কিটেকচার

শুধুমাত্র-ডিকোডার মডেলের মূল ধারণা হলো **অটোরিগ্রেসিভ জেনারেশন** (autoregressive generation) পদ্ধতিতে ক্রম তৈরি করা। এর অর্থ হলো, মডেলটি পূর্বে তৈরি হওয়া সমস্ত token-এর উপর ভিত্তি করে পরবর্তী token পূর্বানুমান করে। ব্যবহারকারীর প্রদত্ত prompt (ইনপুট অনুরোধ) এবং ইতোমধ্যে তৈরি হওয়া টেক্সটকে একটি একক ক্রম হিসেবে বিবেচনা করা হয়, যা মডেলটি আরও এগিয়ে নিয়ে যায়।

আর্কিটেকচারের দিক থেকে, মডেলটি $N$টি অভিন্ন ডিকোডার স্তরের একটি স্তূপ নিয়ে গঠিত। প্রতিটি স্তরে এনকোডার বা সম্পূর্ণ ডিকোডারের বিপরীতে কেবল দুটি মূল উপ-স্তর থাকে:

1.  **মাস্কড মাল্টি-হেড সেলফ-অ্যাটেনশন (Masked Multi-Head Self-Attention):** এটি একটি মূল প্রক্রিয়া যা অটোরিগ্রেসিভ বৈশিষ্ট্য নিশ্চিত করে। ক্রম প্রক্রিয়াকরণের সময় একটি বিশেষ **কজাল মাস্ক** (causal mask) প্রতিটি token-কে পরবর্তী token-গুলো "দেখতে" বাধা দেয়। এভাবে, $i$ অবস্থানের পূর্বানুমান কেবল $< i$ অবস্থানগুলোর token-এর উপর নির্ভর করে।
2.  **ফিড-ফরওয়ার্ড নেটওয়ার্ক (Feed-Forward Network):** প্রতিটি token-এর উপস্থাপনায় অরৈখিক রূপান্তর প্রয়োগ করে।

শুধুমাত্র-ডিকোডার মডেলে **ক্রস-অ্যাটেনশন (cross-attention)** প্রক্রিয়া অনুপস্থিত, কারণ এখানে কোনো এনকোডার নেই যার প্রতি "মনোযোগ দেওয়া" যাবে।

## প্রাক-প্রশিক্ষণের কাজ

শুধুমাত্র-ডিকোডার মডেলগুলো একটিমাত্র কিন্তু অত্যন্ত শক্তিশালী স্ব-নিয়ন্ত্রিত কাজে প্রশিক্ষিত হয়:

### কজাল ল্যাঙ্গুয়েজ মডেলিং (Causal Language Modeling, CLM)

- **কার্যপদ্ধতি:** মডেলটি একটি ক্রমের পরবর্তী token পূর্বানুমান করতে শেখে। প্রশিক্ষণের প্রতিটি ধাপে এটি একটি টেক্সট অংশ ইনপুট হিসেবে পায় এবং পরবর্তী token-এর জন্য সম্ভাবনার বিতরণ তৈরি করতে হয়।
- **লক্ষ্য:** বিশাল পরিমাণ টেক্সট ডেটায় সঠিক পরবর্তী token-এর সম্ভাবনা সর্বোচ্চ করা। প্রথম দর্শনে সরল মনে হওয়া এই কাজটি মডেলকে ব্যাকরণ, বাক্যগঠন, বিশ্ব সম্পর্কিত তথ্য এবং ভাষার জটিল নিয়মকানুন শিখতে বাধ্য করে।

## প্রয়োগ

অটোরিগ্রেসিভ প্রকৃতির কারণে, শুধুমাত্র-ডিকোডার মডেলগুলো টেক্সট জেনারেশনের প্রয়োজন এমন যেকোনো কাজের জন্য আদর্শ:

- **মুক্ত আকারে টেক্সট জেনারেশন:** নিবন্ধ, কবিতা, চিত্রনাট্য ইত্যাদি লেখা।
- **কথোপকথন ব্যবস্থা ও চ্যাটবট:** কথোপকথনমূলক ভঙ্গিতে ব্যবহারকারীর প্রশ্নের উত্তর দেওয়া।
- **সারসংক্ষেপ:** দীর্ঘ টেক্সটের সংক্ষিপ্ত বিবরণ তৈরি করা।
- **মেশিন ট্রান্সলেশন:** যদিও এর জন্য প্রায়ই এনকোডার-ডিকোডার মডেল ব্যবহার করা হয়, শুধুমাত্র-ডিকোডার মডেলগুলোও অনুবাদ করতে পারে যদি কাজটি prompt-এ সংজ্ঞায়িত করা হয় (যেমন, "ইংরেজি থেকে বাংলায় অনুবাদ করো: ...")।
- **কোড লেখা:** টেক্সট বিবরণ থেকে কোড তৈরি করা।
- **ইন-কনটেক্সট লার্নিং (In-context learning):** বড় আকারের কারণে, বড় ডিকোডার মডেলগুলো fine-tuning ছাড়াই সরাসরি prompt-এ মাত্র কয়েকটি উদাহরণ (*few-shot*) বা এমনকি কোনো উদাহরণ ছাড়াই (*zero-shot*) নতুন কাজ সমাধান করার সক্ষমতা প্রদর্শন করে।

## প্রধান মডেল ও তাদের বিকাশ

- **GPT সিরিজ** (২০১৮-বর্তমান): এই পদ্ধতির পথিকৃৎ ও জনপ্রিয়তাকারী। GPT-1 প্রাক-প্রশিক্ষণের কার্যকারিতা দেখিয়েছে, GPT-2 মাপকাঠি বৃদ্ধির শক্তি প্রদর্শন করেছে, এবং GPT-3 — *few-shot* সক্ষমতার আবির্ভাব ঘটিয়েছে। ChatGPT এবং GPT-4 এই আর্কিটেকচারকে AI-অ্যাসিস্ট্যান্টের মানদণ্ড হিসেবে প্রতিষ্ঠিত করেছে।
- **LLaMA** (২০২৩-বর্তমান): Meta-এর উন্মুক্ত মডেলের একটি সিরিজ, যা শক্তিশালী LLM-এর অ্যাক্সেসকে গণতান্ত্রিক করেছে এবং সম্প্রদায়ে উদ্ভাবনের ঢেউ তুলেছে।
- **Claude** (২০২৩-বর্তমান): Anthropic-এর মডেল পরিবার, যা **Constitutional AI** ব্যবহার করে নিরাপত্তা ও নিয়ন্ত্রণযোগ্যতার উপর দৃষ্টি নিবদ্ধ করেছে।
- **PaLM** ও **Gemini** (২০২২-বর্তমান): Google-এর ফ্ল্যাগশিপ মডেল। Gemini একটি নেটিভলি মাল্টিমোডাল শুধুমাত্র-ডিকোডার মডেলও বটে।

## অন্যান্য আর্কিটেকচারের সাথে তুলনা

| আর্কিটেকচার          | প্রধান কাজ            | প্রসঙ্গের দিকনির্দেশনা                | সাধারণ মডেল                |
|---------------------|----------------------|------------------------------------|----------------------------|
| **শুধুমাত্র-ডিকোডার**  | টেক্সট জেনারেশন       | একমুখী (বাম থেকে ডানে)              | GPT, LLaMA, Claude, Gemini |
| **শুধুমাত্র-এনকোডার**  | টেক্সট বোঝা           | দ্বিমুখী                             | BERT, RoBERTa              |
| **এনকোডার-ডিকোডার** | ক্রম থেকে ক্রমে রূপান্তর | দ্বিমুখী (এনকোডার) + একমুখী (ডিকোডার) | T5, BART, মূল Transformer   |

Transformer-ভিত্তিক মূল আর্কিটেকচারগুলোর তুলনা

## আরও দেখুন

- GPT
