---
title: "Transformer architecture — ٹرانسفارمر آرکیٹیکچر"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_ٹرانسفارمر_آرکیٹیکچر"
language: "ur"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Urdu"
revision_id: 8261
wiki_created_at: 2026-09-07T01:14:42Z
wiki_modified_at: 2026-09-07T01:14:42Z
downloaded_at: 2026-09-07T23:24:25Z
---

# Transformer architecture — ٹرانسفارمر آرکیٹیکچر

**Transformer آرکیٹیکچر** — یہ ایک neural network آرکیٹیکچر ہے جسے 2017 میں Google کے محققین نے «Attention Is All You Need» مقالے میں پیش کیا<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>۔ اس نے قدرتی زبان کی پروسیسنگ (NLP) کے شعبے میں انقلاب برپا کیا اور BERT، GPT اور Gemini جیسے زیادہ تر جدید بڑے زبانی ماڈلز (LLM) کی بنیاد بنا۔ Transformer کی کلیدی اختراع **خود-توجہ (self‑attention)** کا طریقہ کار ہے، جو ماڈل کو ان پٹ ڈیٹا کے مختلف حصوں کی اہمیت کو وزن دینے اور سیکوینسز کو متوازی طور پر پروسیس کرنے کی صلاحیت دیتا ہے، اور RNN اور LSTM میں موجود تکراریت سے چھٹکارا دلاتا ہے۔

## تاریخی سیاق و سباق اور پس منظر

2017 سے پہلے، متن جیسے تسلسلی ڈیٹا کی پروسیسنگ کے لیے غالب آرکیٹیکچر تکراری neural networks (RNN) اور ان کا بہتر ورژن — طویل قلیل مدتی یادداشت والے نیٹ ورکس (LSTM) تھے۔

### RNN/LSTM کے وہ مسائل جن کو Transformer نے حل کیا

- **تسلسلی پروسیسنگ کی حدود:** RNN اور LSTM ڈیٹا کو token بہ token پروسیس کرتے ہیں، جس سے سیکوینس کے اندر متوازی پروسیسنگ ناممکن ہو جاتی ہے اور بڑے ڈیٹا پر تربیت سست پڑ جاتی ہے۔
- **غائب اور پھٹتے gradients کا مسئلہ:** لمبے سیکوینسز میں، متعدد مراحل سے پیچھے کی جانب پھیلنے والے gradients یا تو ختم ہو سکتے ہیں یا بڑھ سکتے ہیں، جس سے طویل مدتی انحصار سیکھنا مشکل ہو جاتا ہے۔
- **طویل مدتی انحصار:** سیکوینس کے آغاز کی معلومات اس کے اختتام تک ضائع ہو سکتی ہے۔

Transformer کا طریقہ کار توجہ کے طریقہ کار کے حق میں **تکراریت سے مکمل دستبرداری** ہے۔ یہ کسی بھی دو پوزیشنز کے درمیان انحصار کی **مستقل راستے کی لمبائی** ($O(1)$) فراہم کرتا ہے، جو دور کے انحصار کی ماڈلنگ آسان بناتا ہے، جبکہ self-attention کے بنیادی نفاذ میں سیکوینس کی لمبائی کے لحاظ سے **مربعی حسابی پیچیدگی** ہوتی ہے ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-tay2020-2)</sup>۔ gradients کے ختم ہونے/پھٹنے کا مسئلہ «ختم» نہیں ہوتا، بلکہ residual connections، LayerNorm اور تربیتی طریقہ کار کے ذریعے **نرم** کیا جاتا ہے؛ جدید نفاذ میں اکثر **Pre‑LayerNorm (Pre‑LN)** کا ورژن استعمال ہوتا ہے جو تربیت میں زیادہ مستحکم ہے<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-xiong2020-3)</sup>۔

## آرکیٹیکچر اور کلیدی اجزاء

Transformer کا اصل آرکیٹیکچر دو بنیادی حصوں پر مشتمل ہے: **encoder** اور **decoder**۔ دونوں اجزاء یکساں تہوں کے stack ہیں (اصل مقالے میں $N = 6$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>۔

- **Encoder تہ کی ساخت:** (1) کثیر سری خود-توجہ (MHA)، (2) پوزیشنی-عنصری FFN؛ ہر ذیلی تہ residual connection اور LayerNorm سے گھری ہوئی ہے<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>۔
- **Decoder تہ کی ساخت:** (1) **ماسک شدہ** خود-توجہ (causal mask آنے والی پوزیشنز تک رسائی روکتی ہے)، (2) encoder کے آؤٹ پٹس کی جانب **cross‑attention**، (3) FFN — residuals اور LayerNorm کے ساتھ<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>۔

### توجہ کا طریقہ کار اور Self‑Attention

توجہ کا طریقہ کار Value vectors کا وزنی مجموعہ حساب کرتا ہے، جہاں وزن Query کے ساتھ Key کی مطابقت کی ڈگری سے طے ہوتے ہیں۔ Transformer میں **scaled dot‑product attention** استعمال ہوتا ہے:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

جہاں $d_{k}$ keys/queries کی جہت ہے؛ $\sqrt{d_{k}}$ سے تقسیم softmax کی سیری کو روکتی ہے<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>۔ جب $Q$، $K$ اور $V$ ایک ہی سیکوینس سے پیدا ہوتے ہیں، تو اس طریقہ کار کو **خود-توجہ (self‑attention)** کہتے ہیں۔

### Multi‑Head Attention - کثیر سری توجہ

ماترکسز $(W_{Q},W_{K},W_{V})$ کے ایک سیٹ کی بجائے $h$ متوازی «heads» استعمال ہوتے ہیں، جن میں سے ہر ایک $Q,K,V$ کو چھوٹی جہت والے ذیلی فضاوں میں project کرتا ہے، آزادانہ توجہ حساب کرتا ہے، پھر نتائج کو یکجا کر کے project کیا جاتا ہے<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**inference کو تیز کرنے کے لیے ورژنز:**

- **MQA (Multi‑Query Attention):** تمام heads ایک key/value شیئر کرتے ہیں → decoding کے دوران KV‑cache کا حجم اور ٹریفک نمایاں طور پر کم ہوتا ہے<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-shazeer2019-4)</sup>۔
- **GQA (Grouped‑Query Attention):** MHA اور MQA کے درمیان سمجھوتہ — heads کے کئی گروپ K/V شیئر کرتے ہیں؛ معیار MQA کی رفتار پر MHA کے قریب ہے<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-ainslie2023-5)</sup>۔

### Positional Encoding - پوزیشنی کوڈنگ

چونکہ self-attention tokens کی ترتیب سے بے نیاز ہے، اس لیے ان پٹ embeddings میں **پوزیشنی کوڈنگ** شامل کی جاتی ہے۔

- **اصل sinusoidal کوڈنگ** (PE) از<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **جدید relative/rotary ورژنز:**
  - **RoPE (Rotary Position Embeddings)** $Q$/$K$ vectors کی گردش کے ذریعے relative shifts کو encode کرتا ہے؛ کچھ جدید LLM میں استعمال ہوتا ہے<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-su2021-6)</sup>۔
  - **ALiBi** توجہ کے اسکورز میں linear جرمانہ شامل کرتا ہے، جو تربیتی لمبائی سے زیادہ لمبائیوں پر extrapolation کو بہتر بناتا ہے<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-press2021-7)</sup>۔

### عنصری FFN، residuals اور normalization

encoder اور decoder کی ہر تہ، توجہ کے علاوہ، **پوزیشنی-عنصری FFN** پر مشتمل ہے:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

ہر ذیلی تہ کے گرد **residual connections** اور **Layer Normalization** استعمال ہوتی ہے: ${LayerNorm}(x + {Sublayer}(x))$۔ اصل میں **Post‑LN** ورژن استعمال ہوتا تھا<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>؛ جدید LLM میں اکثر بہتر تربیتی استحکام اور warm‑up پر کم انحصار کے لیے **Pre‑LN** استعمال ہوتا ہے<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-xiong2020-3)</sup>۔

## ارتقاء اور جدید ورژنز

تکراری neural networks (RNN) اور ان کے ترقی یافتہ ورژنز جیسے LSTM پر مبنی ابتدائی طریقے متن کو یکے بعد دیگرے، ایک وقت میں ایک token کے حساب سے پروسیس کرتے تھے۔ اگرچہ یہ طریقہ زبان کی ساخت کے ساتھ بدیہی طور پر ہم آہنگ تھا، لیکن اس نے ایک اہم حد پیدا کی: متوازی حسابات مشکل ہو گئے اور متن میں دور دور موجود عناصر کے درمیان انحصار تلاش کرنا پیچیدہ ہو گیا۔ 2017 میں Google کے محققین کے ایک گروپ نے «Attention Is All You Need» کے عنوان سے ایک مقالہ پیش کیا۔ اس میں انہوں نے ایک نئے آرکیٹیکچر — «Transformer» — کی وضاحت کی۔ اس ماڈل نے پہلی بار تکراری neural networks کا استعمال مکمل طور پر ترک کر کے انہیں توجہ (attention) کے طریقہ کار سے بدل دیا۔ بنیادی نئی بات یہ تھی کہ توجہ کا طریقہ کار Transformer کو آؤٹ پٹ میں متعلقہ لفظ پیدا کرنے کے لیے ان پٹ سیکوینس میں ہر لفظ کی اہمیت جانچنے دیتا تھا۔ اس کے ساتھ ماڈل تمام الفاظ کو بیک وقت پروسیس کر سکتا تھا۔ متوازی پروسیسنگ کی اس صلاحیت نے ڈیٹا کی بہت بڑی مقدار پر کہیں زیادہ بڑے ماڈلز کی تربیت ممکن بنائی۔ نتیجتاً جدید بڑے زبانی ماڈلز (LLM) وجود میں آئے۔

Transformer آرکیٹیکچر نے بہت سے ماڈلز کی بنیاد فراہم کی، جو تین کلاسوں میں تقسیم ہوتے ہیں۔

### 1. صرف‑encoder ماڈلز (Encoder‑only)

- **مثال:** BERT (اور RoBERTa، ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-devlin2019-8)</sup>۔
- **اصول:** دو طرفہ سیاق کے ساتھ **ماسک شدہ زبانی ماڈلنگ (MLM)** کے کام پر پیش تربیت۔
- **استعمال:** سمجھ بوجھ کے کام (درجہ بندی، NER وغیرہ)۔

### 2. صرف‑decoder ماڈلز (Decoder‑only)

- **مثال:** GPT سیریز (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-brown2020-10)</sup>، LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-llama2023-11)</sup>، Claude۔
- **اصول:** **causal زبانی ماڈلنگ (CLM)** — اگلے token کی پیش گوئی؛ توجہ پر causal mask لگائی جاتی ہے<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>۔
- **استعمال:** متن کی تخلیق، مکالمہ، کوڈ۔

### 3. encoder‑decoder ماڈلز (Encoder‑decoder)

- **مثال:** اصل Transformer، T5، BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-raffel2019-12)</sup>۔
- **اصول:** encoder ان پٹ کی نمائندگی بناتا ہے، decoder آؤٹ پٹ تیار کرتا ہے اور encoder کی خصوصیات کی جانب cross‑attention استعمال کرتا ہے<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-vaswani2017-1)</sup>۔
- **استعمال:** seq2seq کام (ترجمہ، خلاصہ سازی وغیرہ)۔

### 4. ملٹی موڈل اور متبادل آرکیٹیکچرز

- **Vision Transformer (ViT)** — تصاویر کے لیے موافقت (patches میں تقسیم)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-dosovitskiy2020-13)</sup>؛ **Swin Transformer** — *shifted windows* کے ساتھ درجہ بندی ماڈل<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-liu2021-swin-14)</sup>۔
- **لمبے سیکوینسز پر متبادل:**
  - **Mamba** — linear پیچیدگی کے ساتھ منتخب state space ماڈلز (SSM)<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-gu2023-mamba-15)</sup>۔
  - **RWKV** — متوازی تربیت اور linear inference پیچیدگی کے ساتھ RNN نما آرکیٹیکچر<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-peng2023-rwkv-16)</sup>۔
  - **ہائبرڈ** (مثلاً **Jamba**): Transformer اور Mamba blocks کو باری باری استعمال کرتے ہیں؛ کبھی کبھار MoE سے بھی مزین ہوتے ہیں<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-lieber2024-jamba-17)</sup>۔

## تربیت اور اصلاح کی تکنیکیں

Transformer کی کارکردگی کا تربیتی تکنیک اور بنیادی ڈھانچے سے گہرا تعلق ہے۔

- **پیش تربیت کی حکمت عملیاں:** CLM اور MLM؛ نیز تضادی اور denoise کرنے والے اہداف (ELECTRA، T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-raffel2019-12)</sup>۔
- **fine‑tuning کی تکنیکیں:**
  - **تمام parameters کا مکمل fine‑tuning**۔
  - **Parameter‑efficient fine‑tuning (PEFT):** **LoRA** منجمد بنیادی weights کے ساتھ low‑rank adapters متعارف کراتا ہے<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-hu2021-lora-18)</sup>۔
- **رویے کی ہم آہنگی:** **RLHF** — انسانی رائے کی بنیاد پر reinforcement learning<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-ouyang2022-rlhf-19)</sup>۔
- **Inference کی نظامی اصلاحات:** **PagedAttention/vLLM** KV‑cache کے صفحاتی انتظام کے ذریعے serving کی throughput بڑھاتے ہیں؛ لمبے سیکوینسز اور بڑے batches کے لیے خاص طور پر مفید ہے<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_note-kwon2023-vllm-20)</sup>۔

## حوالہ جات

- The Illustrated Transformer — Transformer آرکیٹیکچر کی بصری وضاحت

## کتابیات

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## حواشی

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D9%B9%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D8%A7%D8%B1%D9%85%D8%B1_%D8%A2%D8%B1%DA%A9%DB%8C%D9%B9%DB%8C%DA%A9%DA%86%D8%B1#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
