---
title: "Encoder–decoder architecture — انکوڈر–ڈیکوڈر فن تعمیر"
source: "https://systems-analysis.info/int/Encoder%E2%80%93decoder_architecture_%E2%80%94_%D8%A7%D9%86%DA%A9%D9%88%DA%88%D8%B1%E2%80%93%DA%88%DB%8C%DA%A9%D9%88%DA%88%D8%B1_%D9%81%D9%86_%D8%AA%D8%B9%D9%85%DB%8C%D8%B1"
wiki: "systems-analysis.info/int"
article: "Encoder–decoder_architecture_—_انکوڈر–ڈیکوڈر_فن_تعمیر"
language: "ur"
categories:
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 1974
wiki_created_at: 2026-09-06T22:56:48Z
wiki_modified_at: 2026-09-06T22:56:48Z
downloaded_at: 2026-09-07T22:48:45Z
---

# Encoder–decoder architecture — انکوڈر–ڈیکوڈر فن تعمیر

**انکوڈر-ڈیکوڈر ماڈلز** (انگ. Encoder-Decoder Models) — یہ نیورل نیٹ ورک آرکیٹیکچرز کا ایک ایسا طبقہ ہے جو **ترتیب سے ترتیب میں تبدیلی (sequence-to-sequence, seq2seq)** کے مسائل حل کرنے کے لیے بنایا گیا ہے۔ یہ آرکیٹیکچر دو بنیادی اجزاء پر مشتمل ہے:

- **Encoder (انکوڈر):** ابتدائی ترتیب کو پروسیس کرتا ہے اور اسے ایک مختصر عددی نمائندگی (context vector یا پوشیدہ حالات کی ترتیب) میں سمیٹ دیتا ہے۔
- **Decoder (ڈیکوڈر):** اس نمائندگی کو لے کر اس کی بنیاد پر آؤٹ پٹ ترتیب تیار کرتا ہے۔

یہ آرکیٹیکچر قدرتی زبان پروسیسنگ (NLP) اور کمپیوٹر وژن کے بہت سے مسائل — جیسے مشینی ترجمہ، متن کا خلاصہ اور تصاویر کی تحریری وضاحت — کی بنیاد ہے۔

## تصور

انکوڈر-ڈیکوڈر آرکیٹیکچر کا بنیادی خیال **سمجھنے** اور **تخلیق** کے کاموں کو الگ کرنا ہے۔ Encoder ابتدائی ترتیب کو سمجھنے کا کام کرتا ہے اور اس سے تمام ضروری معنیاتی معلومات نکالتا ہے۔ Decoder نئی ترتیب تیار کرنے کا کام کرتا ہے، اور اس کے لیے Encoder کی فراہم کردہ معلومات استعمال کرتا ہے۔

اس سے ماڈل کو ان پٹ اور آؤٹ پٹ میں مختلف لمبائی کی ترتیبوں کے ساتھ کام کرنا ممکن ہوتا ہے، جو پہلے کی آرکیٹیکچرز میں دشوار تھا۔

## آرکیٹیکچر کا ارتقاء

### RNN/LSTM پر مبنی ابتدائی ماڈلز

شروع میں انکوڈر-ڈیکوڈر آرکیٹیکچر Recurrent Neural Networks (RNN) یا ان کے بہتر نسخے LSTM کے ذریعے نافذ کی گئی تھی۔

- **Encoder:** RNN encoder ابتدائی ترتیب کو ایک ایک token پروسیس کرتا تھا اور آخر میں ایک **context vector** — یعنی آخری token کی پروسیسنگ کے بعد پوشیدہ حالت — دیتا تھا، جس میں پوری ترتیب کی معلومات ہونی چاہیے تھیں۔
- **Decoder:** RNN decoder اس context vector سے آغاز کرتا تھا اور آٹو ریگریسو انداز میں آؤٹ پٹ ترتیب تیار کرتا تھا۔

اس طریقے کی بنیادی خامی *بوتل نیک* کا مسئلہ تھی: ابتدائی ترتیب کی ساری معلومات کو ایک مقررہ لمبائی کے ویکٹر میں سمیٹنا پڑتا تھا، جس سے معلومات ضائع ہوتی تھیں، خاص طور پر لمبی ترتیبوں میں۔

### attention mechanism کا نفاذ

یہ پیش رفت **attention mechanism** کے نفاذ کے ساتھ ہوئی (Bahdanau et al., 2014)۔

- **اصول کار:** ایک context vector پر انحصار کرنے کے بجائے، decoder تخلیق کے ہر مرحلے میں Encoder کی **تمام** پوشیدہ حالتوں پر *توجہ* دیتا ہے۔ وہ attention کے وزن حساب کرتا ہے جو یہ ظاہر کرتے ہیں کہ ابتدائی ترتیب کے کون سے حصے موجودہ آؤٹ پٹ token کی تخلیق کے لیے سب سے زیادہ متعلقہ ہیں۔
- **فوائد:** اس نے *بوتل نیک* کا مسئلہ حل کیا اور ماڈل کو لمبی ترتیبوں کے ساتھ مؤثر طریقے سے کام کرنے دیا، خاص طور پر مشینی ترجمے میں معیار میں نمایاں بہتری آئی۔

### Transformer آرکیٹیکچر

2017 میں مقالے «Attention Is All You Need» میں **Transformer** آرکیٹیکچر پیش کی گئی، جس نے تکراریت کو مکمل طور پر ترک کر کے attention mechanism کو اپنایا۔

- **Transformer Encoder:** پرتوں کے ایک stack پر مشتمل ہے، جن میں سے ہر ایک ہر ابتدائی token کے لیے contextualised نمائندگی بنانے کے لیے **self-attention** استعمال کرتی ہے۔
- **Transformer Decoder:** پرتوں کے ایک stack پر مشتمل ہے، جن میں سے ہر ایک میں دو قسم کے attention mechanisms ہیں:
  - **Masked self-attention:** آؤٹ پٹ ترتیب کے پہلے سے تیار شدہ حصے کی پروسیسنگ کے لیے۔
  - **Cross-Attention:** Encoder کی آؤٹ پٹ نمائندگیوں پر *توجہ* دینے کے لیے۔

یہ آرکیٹیکچر اپنی اعلیٰ کارکردگی اور حسابات کی متوازی پروسیسنگ کی صلاحیت کی وجہ سے seq2seq مسائل کا معیار بن گئی۔

## اطلاق

انکوڈر-ڈیکوڈر آرکیٹیکچر مسائل کے ایک وسیع دائرے کے لیے معیار ہے:

- **مشینی ترجمہ:** کسی جملے کو ایک زبان سے دوسری زبان میں تبدیل کرنا۔
- **متن کا خودکار خلاصہ:** کسی طویل دستاویز کا مختصر خلاصہ تیار کرنا۔
- **مکالماتی نظام:** صارف کے بیان کے جواب میں ردِعمل تیار کرنا۔
- **تصاویر کی تحریری وضاحت (Image Captioning):** Encoder (اکثر convolutional neural network پر مبنی) تصویر کو پروسیس کرتا ہے، جبکہ Decoder (اکثر RNN یا Transformer) اس کی متنی وضاحت تیار کرتا ہے۔
- **تقریر کی شناخت:** آڈیو سگنل کو متنی نقل میں تبدیل کرنا۔

## اہم ماڈلز

- **اصل Transformer** (Vaswani et al., 2017): وہ ماڈل جس نے یہ آرکیٹیکچر پیش کی۔
- **BART** (Bidirectional and Auto-Regressive Transformers): Facebook کا ماڈل جو *خراب* متن کی بحالی کے کام پر پہلے سے تربیت یافتہ ہے۔ Encoder دو طرفہ ہے (جیسے BERT میں)، اور Decoder آٹو ریگریسو ہے (جیسے GPT میں)۔
- **T5** (Text-to-Text Transfer Transformer): Google کا ماڈل جو تمام NLP مسائل کو متن سے متن میں تبدیلی کے مسئلے کے طور پر یکجا کرتا ہے۔ T5 نے متعدد benchmarks پر شاندار نتائج دیے ہیں۔

## دیگر آرکیٹیکچرز کے ساتھ موازنہ

| آرکیٹیکچر           | بنیادی کام                | اجزاء             | عمومی ماڈلز               |
|---------------------|---------------------------|-------------------|---------------------------|
| **Encoder-Decoder** | ترتیب سے ترتیب میں تبدیلی | Encoder + Decoder | T5, BART, اصل Transformer |
| **صرف-Encoder**     | متن کی سمجھ               | صرف Encoder       | BERT, RoBERTa             |
| **صرف-Decoder**     | متن کی تخلیق              | صرف Decoder       |                           |

Transformer پر مبنی اہم آرکیٹیکچرز کا موازنہ

- 

## حوالہ جات

- Bahdanau, D. et al. (2014). *Neural Machine Translation by Jointly Learning to Align and Translate*. arXiv:1409.0473.
- Sutskever, I. et al. (2014). *Sequence to Sequence Learning with Neural Networks*. arXiv:1409.3215.
- Luong, M.-T. et al. (2015). *Effective Approaches to Attention-based Neural Machine Translation*. arXiv:1508.04025.
- Wu, Y. et al. (2016). *Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation*. arXiv:1609.08144.
- Vaswani, A. et al. (2017). *Attention Is All You Need*. arXiv:1706.03762.
- Britz, D. et al. (2017). *Massive Exploration of Neural Machine Translation Architectures*. arXiv:1703.03906.
- Lewis, M. et al. (2020). *BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation*. arXiv:1910.13461.
- Raffel, C. et al. (2020). *Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer*. arXiv:1910.10683.
- Dong, L. et al. (2019). *Unified Language Model Pre-training for Natural Language Understanding and Generation*. arXiv:1905.03197.
- Zhang, J. et al. (2020). *PEGASUS: Pre-training with Extracted Gap-Sentences for Abstractive Summarization*. arXiv:1912.08777.
