---
title: "Decoder-only models (architecture) (UR)"
source: "https://systems-analysis.info/int/Decoder-only_models_(architecture)_(UR)"
wiki: "systems-analysis.info/int"
article: "Decoder-only_models_(architecture)_(UR)"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 1551
wiki_created_at: 2026-09-06T22:50:25Z
wiki_modified_at: 2026-09-06T22:50:25Z
downloaded_at: 2026-09-07T22:46:33Z
---

# Decoder-only models (architecture) (UR)

**صرف ڈیکوڈر ماڈل** (انگریزی: Decoder-Only Models) — یہ بڑے لسانی ماڈلز (LLM) کے فن تعمیر کا غالب طبقہ ہے، جو **Transformer** فن تعمیر کے صرف **ڈیکوڈنگ** حصے (ڈیکوڈر) پر مبنی ہوتا ہے۔ یہ ماڈل **متن کی تخلیق** کے کاموں میں مہارت رکھتے ہیں اور زیادہ تر جدید چیٹ بوٹس اور AI اسسٹنٹس کی بنیاد ہیں۔

اس طریقہ کار کو مقبول بنانے والی سرکردہ سیریز OpenAI کی **GPT** ماڈل سیریز ہے۔

## تصور اور فن تعمیر

صرف ڈیکوڈر ماڈلز کا بنیادی خیال **خود بازگشتی (autoregressive) تسلسل کی تخلیق** ہے۔ اس کا مطلب یہ ہے کہ ماڈل اگلے token کا اندازہ ان تمام پچھلے tokens کی بنیاد پر لگاتا ہے جو اس سے پہلے تخلیق ہو چکے ہوں۔ صارف کا input prompt اور پہلے سے تخلیق شدہ متن ایک ہی تسلسل کے طور پر سمجھا جاتا ہے، جسے ماڈل آگے بڑھاتا ہے۔

فن تعمیر کے لحاظ سے، ماڈل $N$ یکساں ڈیکوڈر پرتوں کا ایک ڈھیر ہے۔ ہر پرت، encoder یا مکمل decoder کے برعکس، صرف دو بنیادی ذیلی پرتیں رکھتی ہے:

1.  **ماسک شدہ کثیر سری خود توجہ (Masked Multi-Head Self-Attention):** یہ وہ کلیدی طریقہ کار ہے جو خود بازگشتی خاصیت کو یقینی بناتا ہے۔ تسلسل پر کارروائی کے دوران ایک خاص **کاز ایشنل ماسک** (causal mask) ہر token کو بعد کے tokens پر *نظر ڈالنے* سے روکتا ہے۔ اس طرح، مقام $i$ کے لیے پیشین گوئی صرف مقامات $< i$ کے tokens پر منحصر ہوتی ہے۔
2.  **مکمل طور پر جڑی ہوئی عصبی شبکہ (Feed-Forward Network):** ہر token کی نمائندگی پر غیر خطی تبدیلی لاگو کرتی ہے۔

صرف ڈیکوڈر ماڈلز میں **کراس توجہ (cross-attention)** کا طریقہ کار موجود نہیں ہوتا، کیونکہ کوئی encoder ہوتا ہی نہیں جس پر *توجہ مرکوز* کی جا سکے۔

## پیشگی تربیت کے کام

صرف ڈیکوڈر ماڈلز ایک، مگر انتہائی طاقتور خود نگران کام پر تربیت پاتے ہیں:

### کاز ایشنل لسانی ماڈلنگ (Causal Language Modeling, CLM)

- **کام کا اصول:** ماڈل تسلسل میں اگلے token کا اندازہ لگانا سیکھتا ہے۔ تربیت کے ہر مرحلے پر اسے متن کا ایک ٹکڑا دیا جاتا ہے اور اسے اگلے token کے لیے احتمال کی تقسیم تیار کرنی ہوتی ہے۔
- **ہدف:** متن کے ڈیٹا کی وسیع مقدار پر درست اگلے token کا احتمال زیادہ سے زیادہ کرنا۔ بظاہر سادہ یہ کام ماڈل کو گرامر، نحو، دنیا کے حقائق اور زبان کے پیچیدہ نمونے سیکھنے پر مجبور کرتا ہے۔

## استعمال

اپنی خود بازگشتی فطرت کی وجہ سے، صرف ڈیکوڈر ماڈل متن کی تخلیق کی ضرورت والے تمام کاموں کے لیے بہترین ہیں:

- **آزاد شکل میں متن کی تخلیق:** مضامین، نظمیں، منظرنامے وغیرہ لکھنا۔
- **مکالماتی نظام اور چیٹ بوٹس:** گفتگو کے انداز میں صارفین کے سوالات کے جوابات۔
- **خلاصہ نویسی (Summarization):** طویل متن کا مختصر خلاصہ تیار کرنا۔
- **مشینی ترجمہ (Machine Translation):** اگرچہ اس کے لیے اکثر encoder-decoder ماڈل استعمال ہوتے ہیں، لیکن صرف ڈیکوڈر ماڈل بھی ترجمہ کر سکتے ہیں اگر کام کو prompt میں بیان کیا جائے (مثلاً «انگریزی سے اردو میں ترجمہ کریں: ...»)۔
- **کوڈ لکھنا:** متنی وضاحت کی بنیاد پر کوڈ تخلیق کرنا۔
- **سیاق و سباق میں سیکھنا (In-context learning):** اپنے پیمانے کی وجہ سے، بڑے decoder ماڈل prompt میں صرف چند مثالیں (*few-shot*) یا حتیٰ کہ بغیر کسی مثال کے (*zero-shot*) نئے کام حل کرنے کی صلاحیت ظاہر کرتے ہیں، بغیر fine-tuning کی ضرورت کے۔

## بنیادی ماڈل اور ان کا ارتقاء

- **GPT سیریز** (2018 تا حال): اس طریقہ کار کے علمبردار اور مقبول بنانے والے۔ GPT-1 نے پیشگی تربیت کی کارآمدی ظاہر کی، GPT-2 نے پیمانے کی طاقت دکھائی، اور GPT-3 نے *few-shot* صلاحیتوں کا ظہور کیا۔ ChatGPT اور GPT-4 نے اس فن تعمیر کو AI اسسٹنٹس کا معیار بنا دیا۔
- **LLaMA** (2023 تا حال): Meta کی کھلے ماڈلز کی سیریز، جس نے طاقتور LLM تک رسائی کو عام کیا اور کمیونٹی میں اختراعات کی لہر کو تحریک دی۔
- **Claude** (2023 تا حال): Anthropic کے ماڈلز کا خاندان، جو **Constitutional AI** کے ذریعے حفاظت اور قابلِ انتظام ہونے پر مرکوز ہے۔
- **PaLM** اور **Gemini** (2022 تا حال): Google کے سرکردہ ماڈل۔ Gemini بھی ایک مقامی طور پر کثیر طریقہ (multimodal) صرف ڈیکوڈر ماڈل ہے۔

## دیگر فن تعمیرات سے موازنہ

| فن تعمیر            | بنیادی کام                    | سیاق و سباق کی سمت                    | مخصوص ماڈل                 |
|---------------------|-------------------------------|---------------------------------------|----------------------------|
| **صرف ڈیکوڈر**      | متن کی تخلیق                  | یک سمتی (بائیں سے دائیں)              | GPT, LLaMA, Claude, Gemini |
| **صرف encoder**     | متن کی سمجھ                   | دو سمتی                               | BERT, RoBERTa              |
| **Encoder-decoder** | تسلسل کو تسلسل میں تبدیل کرنا | دو سمتی (encoder) + یک سمتی (decoder) | T5, BART, اصل Transformer  |

Transformer پر مبنی کلیدی فن تعمیرات کا موازنہ

## یہ بھی دیکھیں

- GPT
