---
title: "Transformer architecture — ট্রান্সফর্মার"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_ট্রান্সফর্মার"
language: "bn"
categories:
  - "Category:Bengali"
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8263
wiki_created_at: 2026-09-07T01:14:43Z
wiki_modified_at: 2026-09-07T01:14:43Z
downloaded_at: 2026-09-07T23:24:26Z
---

# Transformer architecture — ট্রান্সফর্মার

**Transformer আর্কিটেকচার** — এটি একটি Neural Network আর্কিটেকচার, যা ২০১৭ সালে Google-এর গবেষকরা «Attention Is All You Need» শিরোনামের গবেষণাপত্রে উপস্থাপন করেন<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>। এটি প্রাকৃতিক ভাষা প্রক্রিয়াকরণ (NLP) ক্ষেত্রে বিপ্লব এনেছে এবং BERT, GPT ও Gemini-এর মতো অধিকাংশ আধুনিক বৃহৎ ভাষা মডেল (LLM)-এর ভিত্তি হয়ে উঠেছে। Transformer-এর মূল উদ্ভাবন হলো **self‑attention (স্ব-মনোযোগ) প্রক্রিয়া**, যা মডেলটিকে ইনপুট ডেটার বিভিন্ন অংশের গুরুত্ব নির্ধারণ করতে এবং ক্রমগুলি সমান্তরালভাবে প্রক্রিয়া করতে সক্ষম করে, RNN ও LSTM-এর পুনরাবৃত্তিমূলক বৈশিষ্ট্য ত্যাগ করে।

## ঐতিহাসিক প্রেক্ষাপট ও পূর্বশর্ত

২০১৭ সালের আগে, পাঠ্যের মতো ক্রমিক ডেটা প্রক্রিয়াকরণের জন্য আধিপত্যকারী আর্কিটেকচারগুলি ছিল পুনরাবৃত্তিমূলক Neural Network (RNN) এবং এর উন্নত রূপ — দীর্ঘ স্বল্পমেয়াদী স্মৃতি নেটওয়ার্ক (LSTM)।

### RNN/LSTM-এর সমস্যা যা Transformer সমাধান করেছে

- **ক্রমিক প্রক্রিয়াকরণের সীমাবদ্ধতা:** RNN ও LSTM ডেটা token-এর পর token প্রক্রিয়া করে, যা ক্রম-অভ্যন্তরীণ সমান্তরালতা বাদ দেয় এবং বড় পরিমাণ ডেটায় প্রশিক্ষণ ধীর করে।
- **অদৃশ্য ও বিস্ফোরণশীল gradient-এর সমস্যা:** দীর্ঘ ক্রমে অনেক ধাপের মধ্য দিয়ে পেছনের দিকে প্রচারিত gradient হয় ক্ষয় পেতে পারে অথবা বাড়তে পারে, যা দীর্ঘমেয়াদী নির্ভরতার প্রশিক্ষণকে কঠিন করে।
- **দীর্ঘমেয়াদী নির্ভরতা:** ক্রমের শুরুর তথ্য শেষ পর্যন্ত হারিয়ে যেতে পারে।

Transformer পদ্ধতি হলো attention প্রক্রিয়ার পক্ষে **পুনরাবৃত্তি থেকে সম্পূর্ণ বিরতি**। এটি যেকোনো অবস্থানের মধ্যে **ধ্রুবক দৈর্ঘ্যের নির্ভরতার পথ** নিশ্চিত করে ($O(1)$), যা দূরবর্তী নির্ভরতার মডেলিং সহজ করে, যদিও self-attention-এর মৌলিক বাস্তবায়নের ক্রম দৈর্ঘ্যের উপর **চতুর্ঘাতীয় গণনামূলক জটিলতা** রয়েছে ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-tay2020-2)</sup>। gradient ক্ষয়/বিস্ফোরণের সমস্যা «অদৃশ্য» হয় না, বরং residual সংযোগ, LayerNorm এবং প্রশিক্ষণ মোডের মাধ্যমে **প্রশমিত** হয়; আধুনিক বাস্তবায়নে প্রায়ই **Pre‑LayerNorm (Pre‑LN)** রূপান্তর ব্যবহার করা হয় যা প্রশিক্ষণে আরো স্থিতিশীল<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-xiong2020-3)</sup>।

## আর্কিটেকচার ও মূল উপাদান

মূল Transformer আর্কিটেকচার দুটি প্রধান অংশ নিয়ে গঠিত: **এনকোডার** এবং **ডিকোডার**। উভয় উপাদানই অভিন্ন স্তরের স্তূপ (মূল গবেষণাপত্রে $N = 6$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>।

- **এনকোডার স্তরের কাঠামো:** (১) Multi-Head Attention (MHA), (২) অবস্থান-উপাদানভিত্তিক FFN; প্রতিটি উপ-স্তর residual সংযোগ ও LayerNorm দ্বারা ঘেরা<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>।
- **ডিকোডার স্তরের কাঠামো:** (১) **মাস্কড** self-attention (কারণগত মাস্ক ভবিষ্যৎ অবস্থানে প্রবেশ নিষিদ্ধ করে), (২) এনকোডার আউটপুটের সাথে **cross‑attention**, (৩) FFN — এছাড়াও residual ও LayerNorm সহ<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>।

### Attention প্রক্রিয়া ও Self‑Attention

Attention প্রক্রিয়া Value ভেক্টরের ভারিত সমষ্টি গণনা করে, যেখানে ভার Query-এর সাথে Key-এর সামঞ্জস্যতার মাত্রা দ্বারা নির্ধারিত হয়। Transformer-এ **স্কেলড ডট-প্রোডাক্ট Attention (Scaled Dot‑Product Attention)** ব্যবহার করা হয়:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

যেখানে $d_{k}$ হলো Key/Query-এর মাত্রা; $\sqrt{d_{k}}$ দিয়ে ভাগ করা softmax-এর স্যাচুরেশন প্রতিরোধ করে<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>। যখন $Q$, $K$ ও $V$ একই ক্রম থেকে উৎপন্ন হয়, তখন প্রক্রিয়াটিকে **self‑attention (স্ব-মনোযোগ)** বলা হয়।

### Multi‑Head Attention (বহু-মস্তক মনোযোগ)

ম্যাট্রিক্সের $(W_{Q},W_{K},W_{V})$ একটি সেটের পরিবর্তে $h$টি সমান্তরাল «মস্তক» ব্যবহার করা হয়, যার প্রতিটি $Q,K,V$-কে ছোট মাত্রার উপ-স্থানে প্রজেক্ট করে, স্বাধীনভাবে attention গণনা করে, তারপর ফলাফলগুলি concatenate করে প্রজেক্ট করা হয়<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**দ্রুত inference-এর জন্য রূপান্তরসমূহ:**

- **MQA (Multi‑Query Attention):** সব মস্তক একটি Key/Value ভাগ করে → ডিকোডিংয়ের সময় KV-ক্যাশের আয়তন ও ট্র্যাফিক উল্লেখযোগ্যভাবে হ্রাস পায়<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-shazeer2019-4)</sup>।
- **GQA (Grouped‑Query Attention):** MHA ও MQA-এর মধ্যে আপোস — মস্তকের কয়েকটি গ্রুপ K/V ভাগ করে; MQA-এর গতিতে MHA-এর কাছাকাছি মান<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-ainslie2023-5)</sup>।

### অবস্থানগত এনকোডিং (Positional Encoding)

যেহেতু self-attention token-এর ক্রমের প্রতি অপরিবর্তনীয়, তাই ইনপুট embedding-এ **অবস্থানগত কোডিং** যোগ করা হয়।

- <sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup> থেকে **মূল সাইনুসয়েডাল কোডিং** (PE):

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **আধুনিক আপেক্ষিক/ঘূর্ণনমূলক রূপান্তর:**
  - **RoPE (Rotary Position Embeddings)** $Q$/$K$ ভেক্টরের ঘূর্ণনের মাধ্যমে আপেক্ষিক স্থানান্তর এনকোড করে; বেশ কিছু আধুনিক LLM-এ ব্যবহৃত হয়<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-su2021-6)</sup>।
  - **ALiBi** attention স্কোরে রৈখিক জরিমানা আরোপ করে, যা প্রশিক্ষণের চেয়ে বড় দৈর্ঘ্যে এক্সট্রাপোলেশন উন্নত করে<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-press2021-7)</sup>।

### উপাদানভিত্তিক FFN, Residual সংযোগ ও নর্মালাইজেশন

এনকোডার ও ডিকোডারের প্রতিটি স্তরে attention ছাড়াও একটি **অবস্থান-উপাদানভিত্তিক FFN** রয়েছে:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

প্রতিটি উপ-স্তরের চারপাশে **অবশিষ্ট সংযোগ (residual connections)** ও **Layer Normalization** ব্যবহার করা হয়: ${LayerNorm}(x + {Sublayer}(x))$। মূল গবেষণাপত্রে **Post‑LN** রূপান্তর ব্যবহার করা হয়েছিল<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>; আধুনিক LLM-এ প্রায়ই **Pre‑LN** ব্যবহার করা হয় প্রশিক্ষণের ভালো স্থিতিশীলতা ও দীর্ঘ warm‑up-এর উপর কম নির্ভরতার জন্য<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-xiong2020-3)</sup>।

## বিবর্তন ও আধুনিক রূপান্তর

RNN এবং LSTM-এর মতো এর উন্নত রূপের উপর ভিত্তি করে প্রাথমিক পদ্ধতিগুলি পাঠ্য ক্রমানুসারে, এক সময়ে একটি token প্রক্রিয়া করত। যদিও এই পদ্ধতিটি স্বজ্ঞাতভাবে ভাষার কাঠামোর সাথে সামঞ্জস্যপূর্ণ ছিল, তবুও এটি একটি উল্লেখযোগ্য সীমাবদ্ধতা তৈরি করেছিল: সমান্তরাল গণনা কঠিন করে তুলেছিল এবং পাঠ্যে একে অপরের থেকে দূরে অবস্থিত উপাদানগুলির মধ্যে নির্ভরতা সনাক্ত করা জটিল করে তুলেছিল। ২০১৭ সালে Google-এর একদল গবেষক «Attention Is All You Need» শিরোনামের একটি গবেষণাপত্র উপস্থাপন করেন। সেখানে তারা একটি নতুন আর্কিটেকচার — «Transformer» বর্ণনা করেন। এই মডেলটি প্রথমবারের মতো সম্পূর্ণরূপে পুনরাবৃত্তিমূলক Neural Network ব্যবহার ত্যাগ করে, সেগুলিকে «attention» (মনোযোগ) প্রক্রিয়া দিয়ে প্রতিস্থাপন করে। মূল উদ্ভাবন ছিল যে attention প্রক্রিয়া Transformer-কে আউটপুটে সংশ্লিষ্ট শব্দ তৈরির জন্য ইনপুট ক্রমের প্রতিটি শব্দের গুরুত্ব মূল্যায়ন করতে সক্ষম করেছিল। একই সাথে মডেলটি সব শব্দ একসাথে প্রক্রিয়া করতে পারত। সমান্তরাল প্রক্রিয়াকরণের এই ক্ষমতা বিশাল পরিমাণ ডেটায় অনেক বড় মডেল প্রশিক্ষণ সম্ভব করে তুলেছিল। ফলে আধুনিক বৃহৎ ভাষা মডেল (LLM) আবির্ভূত হয়েছে।

Transformer আর্কিটেকচার অসংখ্য মডেলের ভিত্তি হয়েছে, যেগুলিকে আনুমানিকভাবে তিনটি শ্রেণিতে ভাগ করা যায়।

### ১. শুধুমাত্র-এনকোডার মডেল (Encoder‑only)

- **উদাহরণ:** BERT (এবং RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-devlin2019-8)</sup>।
- **নীতি:** দ্বিমুখী প্রসঙ্গ সহ **মাস্কড ভাষা মডেলিং (MLM)** কাজে পূর্ব-প্রশিক্ষণ।
- **প্রয়োগ:** বোঝার কাজ (শ্রেণীবিভাগ, NER ইত্যাদি)।

### ২. শুধুমাত্র-ডিকোডার মডেল (Decoder‑only)

- **উদাহরণ:** GPT সিরিজ (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-llama2023-11)</sup>, Claude।
- **নীতি:** **কারণগত ভাষা মডেলিং (CLM)** — পরবর্তী token পূর্বানুমান; attention-এ কারণগত মাস্ক আরোপ করা হয়<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>।
- **প্রয়োগ:** পাঠ্য তৈরি, সংলাপ, কোড।

### ৩. এনকোডার-ডিকোডার মডেল (Encoder‑decoder)

- **উদাহরণ:** মূল Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-raffel2019-12)</sup>।
- **নীতি:** এনকোডার ইনপুটের প্রতিনিধিত্ব তৈরি করে, ডিকোডার আউটপুট তৈরি করে এবং এনকোডারের বৈশিষ্ট্যের সাথে cross-attention ব্যবহার করে<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-vaswani2017-1)</sup>।
- **প্রয়োগ:** seq2seq কাজ (অনুবাদ, সারসংক্ষেপ ইত্যাদি)।

### ৪. মাল্টিমোডাল ও বিকল্প আর্কিটেকচার

- **Vision Transformer (ViT)** — চিত্রের সাথে অভিযোজন (প্যাচে বিভাজন)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — *shifted windows* সহ শ্রেণিবদ্ধ মডেল<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-liu2021-swin-14)</sup>।
- **দীর্ঘ ক্রমের জন্য বিকল্পসমূহ:**
  - **Mamba** — রৈখিক জটিলতা সহ নির্বাচনী State Space Model (SSM)<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-gu2023-mamba-15)</sup>।
  - **RWKV** — সমান্তরাল প্রশিক্ষণ ও রৈখিক inference জটিলতা সহ RNN-সদৃশ আর্কিটেকচার<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-peng2023-rwkv-16)</sup>।
  - **হাইব্রিড** (যেমন, **Jamba**): Transformer ও Mamba ব্লক পর্যায়ক্রমে ব্যবহার করে; কখনো কখনো MoE দিয়ে সম্পূরিত<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-lieber2024-jamba-17)</sup>।

## প্রশিক্ষণ ও অপ্টিমাইজেশন কৌশল

Transformer-এর কার্যকারিতা প্রশিক্ষণ কৌশল ও পরিকাঠামোর সাথে ঘনিষ্ঠভাবে সম্পর্কিত।

- **পূর্ব-প্রশিক্ষণ কৌশল:** CLM ও MLM; এছাড়াও contrastive ও denoising লক্ষ্য (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-raffel2019-12)</sup>।
- **Fine‑tuning কৌশল:**
  - সমস্ত প্যারামিটারের **সম্পূর্ণ fine‑tuning**।
  - **প্যারামিটার-দক্ষ fine‑tuning (PEFT):** **LoRA** হিমায়িত মূল ওজন সহ নিম্ন-মান adapter প্রবর্তন করে<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-hu2021-lora-18)</sup>।
- **আচরণ সংযোজন:** **RLHF** — মানুষের প্রতিক্রিয়ার উপর ভিত্তি করে Reinforcement Learning<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-ouyang2022-rlhf-19)</sup>।
- **Inference-এর সিস্টেম অপ্টিমাইজেশন:** **PagedAttention/vLLM** KV-ক্যাশের পেজভিত্তিক ব্যবস্থাপনার মাধ্যমে সার্ভিংয়ের থ্রুপুট বাড়ায়; দীর্ঘ ক্রম ও বড় batch-এ বিশেষভাবে কার্যকর<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_note-kwon2023-vllm-20)</sup>।

## তথ্যসূত্র

- The Illustrated Transformer — Transformer আর্কিটেকচারের দৃশ্যমান ব্যাখ্যা

## সাহিত্য

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## টীকা

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%A6%9F%E0%A7%8D%E0%A6%B0%E0%A6%BE%E0%A6%A8%E0%A7%8D%E0%A6%B8%E0%A6%AB%E0%A6%B0%E0%A7%8D%E0%A6%AE%E0%A6%BE%E0%A6%B0#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
