---
title: "Transformer architecture — ट्रांसफॉर्मर आर्किटेक्चर"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_ट्रांसफॉर्मर_आर्किटेक्चर"
language: "hi"
categories:
  - "Category:Core LLM concepts"
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8262
wiki_created_at: 2026-09-07T01:14:43Z
wiki_modified_at: 2026-09-07T01:14:43Z
downloaded_at: 2026-09-07T23:24:25Z
---

# Transformer architecture — ट्रांसफॉर्मर आर्किटेक्चर

**Transformer आर्किटेक्चर** — यह एक Neural Network आर्किटेक्चर है, जिसे 2017 में Google के शोधकर्ताओं ने «Attention Is All You Need» शीर्षक के शोधपत्र में प्रस्तुत किया था<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>। इसने Natural Language Processing (NLP) के क्षेत्र में क्रांति ला दी और BERT, GPT तथा Gemini जैसे अधिकांश आधुनिक Large Language Models (LLM) की नींव बन गई। Transformer की प्रमुख नवीनता **Self‑Attention का तंत्र** है, जो मॉडल को इनपुट डेटा के विभिन्न भागों के महत्व को तौलने और अनुक्रमों को समानांतर में संसाधित करने की अनुमति देता है — इस प्रकार RNN और LSTM में निहित पुनरावर्तता (recurrence) को त्याग दिया गया।

## ऐतिहासिक संदर्भ और पूर्वापेक्षाएँ

2017 से पहले, अनुक्रमिक डेटा जैसे पाठ को संसाधित करने के लिए प्रमुख आर्किटेक्चर Recurrent Neural Networks (RNN) और उनका उन्नत संस्करण — Long Short-Term Memory (LSTM) नेटवर्क — थे।

### RNN/LSTM की समस्याएँ जिन्हें Transformer ने संबोधित किया

- **अनुक्रमिक प्रसंस्करण की सीमाएँ:** RNN और LSTM डेटा को token दर token संसाधित करते हैं, जिससे अनुक्रम के भीतर समानांतरता संभव नहीं होती और बड़े डेटा पर प्रशिक्षण धीमा हो जाता है।
- **विलुप्त होते और विस्फोट होते Gradient की समस्या:** लंबे अनुक्रमों में, कई चरणों से पीछे की ओर प्रसारित होने वाले gradient या तो क्षीण हो सकते हैं या बढ़ सकते हैं, जिससे दीर्घकालिक निर्भरताओं का प्रशिक्षण कठिन हो जाता है।
- **दीर्घकालिक निर्भरताएँ:** अनुक्रम की शुरुआत की जानकारी उसके अंत तक पहुँचते-पहुँचते खो सकती है।

Transformer का दृष्टिकोण — ध्यान तंत्र के पक्ष में **पुनरावर्तता का पूर्ण परित्याग** है। यह किसी भी दो स्थितियों के बीच **निर्भरता पथ की स्थिर लंबाई** सुनिश्चित करता है ($O(1)$), जिससे दूरस्थ निर्भरताओं का मॉडलिंग सरल हो जाता है, जबकि Self-Attention के आधारभूत कार्यान्वयन की अनुक्रम लंबाई के सापेक्ष **द्विघाती (quadratic) कम्प्यूटेशनल जटिलता** होती है ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-tay2020-2)</sup>। Gradient के क्षीण होने/विस्फोट की समस्या «समाप्त» नहीं होती, बल्कि residual connections, LayerNorm और प्रशिक्षण विधि के माध्यम से **कम** की जाती है; आधुनिक कार्यान्वयनों में अक्सर **Pre‑LayerNorm (Pre‑LN)** का उपयोग किया जाता है, जो प्रशिक्षण में अधिक स्थिर माना जाता है<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-xiong2020-3)</sup>।

## आर्किटेक्चर और प्रमुख घटक

मूल Transformer आर्किटेक्चर दो मुख्य भागों से मिलकर बना है: **एन्कोडर** और **डिकोडर**। दोनों घटक समान परतों के स्तूप (stack) हैं (मूल शोधपत्र में $N = 6$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>।

- **एन्कोडर परत की संरचना:** (1) Multi-Head Attention (MHA), (2) Position-wise FFN; प्रत्येक उप-परत residual connection और LayerNorm से घिरी होती है<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>।
- **डिकोडर परत की संरचना:** (1) **Masked** Self-Attention (causal mask भविष्य की स्थितियों तक पहुँच को प्रतिबंधित करता है), (2) एन्कोडर के आउटपुट के प्रति **Cross‑Attention**, (3) FFN — residuals और LayerNorm के साथ<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>।

### ध्यान तंत्र और Self‑Attention

ध्यान तंत्र Value वेक्टरों का भारित योग परिकलित करता है, जहाँ भार Key और Query की परस्पर संगतता की मात्रा से निर्धारित होते हैं। Transformer में **Scaled Dot‑Product Attention** का उपयोग किया जाता है:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

जहाँ $d_{k}$ Key/Query की विमा है; $\sqrt{d_{k}}$ से भाग करने पर softmax की संतृप्ति (saturation) रोकी जाती है<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>। जब $Q$, $K$ और $V$ एक ही अनुक्रम से उत्पन्न होते हैं, तो इस तंत्र को **Self‑Attention** कहा जाता है।

### Multi‑Head Attention - बहु-शीर्ष ध्यान

एक ही $(W_{Q},W_{K},W_{V})$ मैट्रिक्स सेट के बजाय $h$ समानांतर «शीर्षों» (heads) का उपयोग किया जाता है, जिनमें से प्रत्येक $Q,K,V$ को छोटे आयाम के उप-स्थानों में प्रक्षेपित करता है, स्वतंत्र रूप से attention परिकलित करता है, फिर परिणाम संयोजित (concatenate) होकर प्रक्षेपित किए जाते हैं<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**इनफरेंस को गति देने के लिए भिन्न रूप:**

- **MQA (Multi‑Query Attention):** सभी heads एक ही Key/Value साझा करते हैं → डिकोडिंग के समय KV‑cache का आयतन और ट्रैफिक उल्लेखनीय रूप से घटता है<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-shazeer2019-4)</sup>।
- **GQA (Grouped‑Query Attention):** MHA और MQA के बीच समझौता — कई Head समूह K/V साझा करते हैं; गुणवत्ता MHA के निकट और गति MQA के समान<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-ainslie2023-5)</sup>।

### Positional Encoding - स्थानीय कूटांकन

चूँकि Self-Attention token के क्रम के प्रति अपरिवर्तनीय है, इसलिए इनपुट embedding में **Positional Encoding** जोड़े जाते हैं।

- <sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup> से **मूल Sinusoidal Encoding** (PE):

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **आधुनिक सापेक्ष/घूर्णी (Rotary) भिन्नताएँ:**
  - **RoPE (Rotary Position Embeddings)** $Q$/$K$ वेक्टरों के घुमाव के माध्यम से सापेक्ष अंतराल को कूटबद्ध करता है; कई आधुनिक LLM में उपयोग होता है<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-su2021-6)</sup>।
  - **ALiBi** attention स्कोर में रैखिक दंड (linear penalty) जोड़ता है, जिससे प्रशिक्षण से अधिक लंबाइयों पर extrapolation बेहतर होती है<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-press2021-7)</sup>।

### Position-wise FFN, Residuals और Normalization

एन्कोडर और डिकोडर की प्रत्येक परत में ध्यान के अतिरिक्त **Position-wise FFN** होती है:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

प्रत्येक उप-परत के चारों ओर **Residual Connections** और **Layer Normalization** उपयोग की जाती है: ${LayerNorm}(x + {Sublayer}(x))$। मूल शोधपत्र में **Post‑LN** का उपयोग था<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>; आधुनिक LLM में बेहतर प्रशिक्षण स्थिरता और warm‑up पर कम निर्भरता के लिए अक्सर **Pre‑LN** उपयोग किया जाता है<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-xiong2020-3)</sup>।

## विकास और आधुनिक भिन्नताएँ

RNN और उनके उन्नत संस्करणों जैसे LSTM पर आधारित प्रारंभिक विधियाँ पाठ को अनुक्रमिक रूप से, एक समय में एक token संसाधित करती थीं। यद्यपि यह दृष्टिकोण भाषा की संरचना के अनुरूप सहज प्रतीत होता था, किंतु इसने एक महत्वपूर्ण सीमा उत्पन्न की: इसने समानांतर परिकलन को कठिन बनाया और पाठ में एक-दूसरे से दूर स्थित तत्वों के बीच निर्भरताओं की पहचान जटिल बना दी। 2017 में Google के शोधकर्ताओं के एक समूह ने «Attention Is All You Need» शीर्षक का शोधपत्र प्रस्तुत किया। इसमें उन्होंने एक नई आर्किटेक्चर — «Transformer» — का वर्णन किया। इस मॉडल ने पहली बार Recurrent Neural Networks का उपयोग पूरी तरह से छोड़ दिया और उन्हें «Attention» तंत्र से प्रतिस्थापित किया। मुख्य नवीनता यह थी कि Attention तंत्र ने Transformer को इनपुट अनुक्रम में प्रत्येक शब्द के महत्व का मूल्यांकन करने की अनुमति दी — आउटपुट में संगत शब्द उत्पन्न करने के लिए। साथ ही मॉडल सभी शब्दों को एक साथ संसाधित कर सकता था। समानांतर प्रसंस्करण की यह क्षमता विशाल डेटा पर बहुत बड़े मॉडलों के प्रशिक्षण को संभव बनाती है। इसके परिणामस्वरूप आधुनिक Large Language Models (LLM) का उदय हुआ।

Transformer आर्किटेक्चर ने अनेक मॉडलों की आधारशिला रखी, जिन्हें मोटे तौर पर तीन वर्गों में विभाजित किया जा सकता है।

### 1. Encoder-only - केवल-एन्कोडर मॉडल

- **उदाहरण:** BERT (और RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-devlin2019-8)</sup>।
- **सिद्धांत:** द्विदिशीय (bidirectional) संदर्भ के साथ **Masked Language Modeling (MLM)** कार्य पर पूर्व-प्रशिक्षण।
- **अनुप्रयोग:** समझ आधारित कार्य (वर्गीकरण, NER आदि)।

### 2. Decoder-only - केवल-डिकोडर मॉडल

- **उदाहरण:** GPT श्रृंखला (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-llama2023-11)</sup>, Claude।
- **सिद्धांत:** **Causal Language Modeling (CLM)** — अगले token की भविष्यवाणी; attention पर causal mask लगाया जाता है<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>।
- **अनुप्रयोग:** पाठ निर्माण, संवाद, कोड।

### 3. Encoder-decoder - एन्कोडर-डिकोडर मॉडल

- **उदाहरण:** मूल Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-raffel2019-12)</sup>।
- **सिद्धांत:** एन्कोडर इनपुट का प्रतिनिधित्व तैयार करता है, डिकोडर आउटपुट उत्पन्न करता है और एन्कोडर की विशेषताओं के प्रति Cross-Attention का उपयोग करता है<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-vaswani2017-1)</sup>।
- **अनुप्रयोग:** seq2seq कार्य (अनुवाद, सारांशीकरण आदि)।

### 4. मल्टीमॉडल और वैकल्पिक आर्किटेक्चर

- **Vision Transformer (ViT)** — छवियों के लिए अनुकूलन (patches में विभाजन)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — *shifted windows* के साथ श्रेणीबद्ध मॉडल<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-liu2021-swin-14)</sup>।
- **लंबे अनुक्रमों के लिए विकल्प:**
  - **Mamba** — रैखिक जटिलता के साथ चयनात्मक State Space Models (SSM)<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-gu2023-mamba-15)</sup>।
  - **RWKV** — RNN-जैसी आर्किटेक्चर जिसमें समानांतर प्रशिक्षण और रैखिक इनफरेंस जटिलता है<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-peng2023-rwkv-16)</sup>।
  - **हाइब्रिड** (उदा., **Jamba**): Transformer और Mamba ब्लॉक बारी-बारी से; कभी-कभी MoE से पूरक<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-lieber2024-jamba-17)</sup>।

## प्रशिक्षण और अनुकूलन तकनीकें

Transformer की प्रभावशीलता प्रशिक्षण तकनीक और बुनियादी ढाँचे से घनिष्ठ रूप से जुड़ी है।

- **पूर्व-प्रशिक्षण रणनीतियाँ:** CLM और MLM; साथ ही contrastive और denoising उद्देश्य (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-raffel2019-12)</sup>।
- **Fine-tuning तकनीकें:**
  - **सभी पैरामीटरों का पूर्ण Fine-tuning**।
  - **Parameter-Efficient Fine-Tuning (PEFT):** **LoRA** आधारभूत भार जमे रखते हुए low-rank adapters जोड़ता है<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-hu2021-lora-18)</sup>।
- **व्यवहार संरेखण (Alignment):** **RLHF** — मानव प्रतिक्रिया पर आधारित Reinforcement Learning<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-ouyang2022-rlhf-19)</sup>।
- **इनफरेंस के लिए सिस्टम अनुकूलन:** **PagedAttention/vLLM** KV‑cache के पेज-आधारित प्रबंधन से सर्विंग थ्रूपुट बढ़ाता है; लंबे अनुक्रमों और बड़े batches के लिए विशेष रूप से उपयोगी<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_note-kwon2023-vllm-20)</sup>।

## संदर्भ

- The Illustrated Transformer — Transformer आर्किटेक्चर की दृश्य व्याख्या

## साहित्य

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## टिप्पणियाँ

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A4%9F%E0%A5%8D%E0%A4%B0%E0%A4%BE%E0%A4%82%E0%A4%B8%E0%A4%AB%E0%A5%89%E0%A4%B0%E0%A5%8D%E0%A4%AE%E0%A4%B0_%E0%A4%86%E0%A4%B0%E0%A5%8D%E0%A4%95%E0%A4%BF%E0%A4%9F%E0%A5%87%E0%A4%95%E0%A5%8D%E0%A4%9A%E0%A4%B0#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
