---
title: "Transformer architecture (RO)"
source: "https://systems-analysis.info/int/Transformer_architecture_(RO)"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_(RO)"
language: "ro"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Romanian"
revision_id: 8251
wiki_created_at: 2026-09-07T01:14:34Z
wiki_modified_at: 2026-09-07T01:14:34Z
downloaded_at: 2026-09-07T23:24:20Z
---

# Transformer architecture (RO)

**Arhitectura Transformer** este o arhitectură de rețea neuronală prezentată în 2017 de cercetători de la Google în articolul «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>. Aceasta a revoluționat domeniul procesării limbajului natural (NLP) și a devenit baza pentru majoritatea modelelor lingvistice mari (LLM) moderne, precum BERT, GPT și Gemini. Inovația cheie a Transformer este mecanismul de **auto-atenție (self‑attention)**, care permite modelului să pondereze importanța diferitelor părți ale datelor de intrare și să proceseze secvențele în paralel, renunțând la recurență, specifică RNN și LSTM.

## Contextul istoric și premisele

Înainte de 2017, arhitecturile dominante pentru procesarea datelor secvențiale, cum ar fi textul, erau rețelele neuronale recurente (RNN) și varianta lor îmbunătățită — rețelele cu memorie pe termen lung și scurt (LSTM).

### Problemele RNN/LSTM abordate de Transformer

- **Limitările procesării secvențiale:** RNN și LSTM procesează datele token cu token, ceea ce exclude paralelismul intra-secvențial și încetinește antrenarea pe volume mari de date.
- **Problema gradienților care dispar sau explodează:** În secvențele lungi, gradienții propagați înapoi prin mulți pași pot fie să se atenueze, fie să crească, ceea ce îngreunează învățarea dependențelor pe termen lung.
- **Dependențele pe termen lung:** Informația de la începutul secvenței poate fi pierdută până la sfârșitul acesteia.

Abordarea Transformer reprezintă o **renunțare completă la recurență** în favoarea mecanismului de atenție. Aceasta asigură o **lungime constantă a căii de dependență** între orice poziții ($O(1)$), facilitând modelarea dependențelor la distanță, în timp ce implementarea de bază a auto-atenției are o **complexitate computațională pătratică** în funcție de lungimea secvenței ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-tay2020-2)</sup>. Problema dispariției/exploziei gradienților nu «dispare», ci este **atenuată** prin conexiuni reziduale, LayerNorm și regimul de antrenare; în implementările moderne se utilizează frecvent varianta **Pre‑LayerNorm (Pre‑LN)** ca fiind mai stabilă în timpul antrenării<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-xiong2020-3)</sup>.

## Arhitectura și componentele cheie

Arhitectura originală Transformer este compusă din două părți principale: **encoder** și **decoder**. Ambele componente sunt stive de straturi identice ($N = 6$ în articolul original)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>.

- **Structura stratului encoder:** (1) atenție multi-cap (MHA), (2) FFN pozițional-element cu element; fiecare substrat este înconjurat de o conexiune reziduală și LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>.
- **Structura stratului decoder:** (1) auto-atenție **mascată** (masca cauzală interzice accesul la pozițiile viitoare), (2) **cross‑attention** la ieșirile encoder-ului, (3) FFN — de asemenea cu reziduale și LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>.

### Mecanismul de atenție și Self‑Attention

Mecanismul de atenție calculează o sumă ponderată a vectorilor-valoare (Value), unde ponderile sunt determinate de gradul de compatibilitate al cheilor (Key) cu interogările (Query). În Transformer se utilizează **atenția scalată prin produs scalar (Scaled Dot‑Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Unde $d_{k}$ este dimensiunea cheilor/interogărilor; împărțirea la $\sqrt{d_{k}}$ previne saturarea softmax<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>. Când $Q$, $K$ și $V$ sunt generate de aceeași secvență, mecanismul se numește **auto-atenție (self‑attention)**.

### Multi‑Head Attention (atenție multi-cap)

În loc de un singur set de matrice $(W_{Q},W_{K},W_{V})$, se utilizează $h$ «capete» paralele, fiecare dintre acestea proiectând $Q,K,V$ în subspatii de dimensiune mai mică, calculând independent atenția, apoi rezultatele sunt concatenate și proiectate<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Variante pentru accelerarea inferenței:**

- **MQA (Multi‑Query Attention):** toate capetele partajează o singură cheie/valoare → volumul și traficul cache-ului KV sunt reduse semnificativ la decodare<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** compromis între MHA și MQA — mai multe grupuri de capete partajează K/V; calitatea este apropiată de MHA la viteza MQA<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-ainslie2023-5)</sup>.

### Codificarea pozițională (Positional Encoding)

Deoarece self‑attention este invariant față de ordinea token-urilor, la embedding-urile de intrare se adaugă **codificări poziționale**.

- **Codificările sinusoidale originale** (PE) din<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Variante relative/rotative moderne:**
  - **RoPE (Rotary Position Embeddings)** codifică deplasările relative prin rotirea vectorilor $Q$/$K$; este utilizat în unele LLM moderne<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-su2021-6)</sup>.
  - **ALiBi** introduce o penalizare liniară în scorurile de atenție, îmbunătățind extrapolarea la lungimi mai mari decât cele de antrenare<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-press2021-7)</sup>.

### FFN element cu element, reziduale și normalizare

Fiecare strat de encoder și decoder, pe lângă atenție, conține o **FFN pozițional-element cu element**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

În jurul fiecărui substrat se utilizează **conexiuni reziduale (residual connections)** și **Layer Normalization**: ${LayerNorm}(x + {Sublayer}(x))$. În original se aplica varianta **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>; în LLM-urile moderne se utilizează frecvent **Pre‑LN** pentru o mai bună stabilitate a antrenării și o dependență mai mică de un warm‑up îndelungat<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-xiong2020-3)</sup>.

## Evoluția și variantele moderne

Metodele timpurii bazate pe rețele neuronale recurente (RNN) și variantele lor avansate, cum ar fi LSTM, procesau textul secvențial, câte un token pe rând. Deși această abordare corespundea intuitiv structurii limbajului, ea crea o limitare semnificativă: îngreuna calculele paralele și complica detectarea dependențelor între elementele aflate la distanță unele de altele în text. În 2017, un grup de cercetători de la Google a prezentat articolul intitulat «Attention Is All You Need». În acesta, ei au descris o nouă arhitectură — «Transformer». Acest model a renunțat pentru prima dată complet la utilizarea rețelelor neuronale recurente, înlocuindu-le cu mecanismul de «atenție» (attention). Noutatea principală consta în faptul că mecanismul de atenție permitea Transformer-ului să evalueze importanța fiecărui cuvânt din secvența de intrare pentru generarea cuvântului corespunzător la ieșire. În același timp, modelul putea procesa toate cuvintele simultan. Această capacitate de procesare paralelă a făcut posibilă antrenarea unor modele mult mai mari pe volume enorme de date. Ca rezultat, au apărut modelele lingvistice mari (LLM) moderne.

Arhitectura Transformer a servit drept bază pentru numeroase modele, clasificate convențional în trei categorii.

### 1. Modele doar-encoder (Encoder‑only)

- **Exemplu:** BERT (și RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-devlin2019-8)</sup>.
- **Principiu:** pre-antrenare pe sarcina de **modelare mascată a limbajului (MLM)** cu context bidirecțional.
- **Aplicare:** sarcini de înțelegere (clasificare, NER etc.).

### 2. Modele doar-decoder (Decoder‑only)

- **Exemplu:** seria GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-llama2023-11)</sup>, Claude.
- **Principiu:** **modelare cauzală a limbajului (CLM)** — predicția token-ului următor; atenției i se aplică o mască cauzală<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>.
- **Aplicare:** generare de text, dialoguri, cod.

### 3. Modele encoder‑decoder (Encoder‑decoder)

- **Exemplu:** Transformer-ul original, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-raffel2019-12)</sup>.
- **Principiu:** encoder-ul construiește reprezentarea intrării, decoder-ul generează ieșirea și utilizează cross‑attention față de caracteristicile encoder-ului<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-vaswani2017-1)</sup>.
- **Aplicare:** sarcini seq2seq (traducere, sumarizare etc.).

### 4. Arhitecturi multimodale și alternative

- **Vision Transformer (ViT)** — adaptare la imagini (împărțire în patch-uri)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — model ierarhic cu *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-liu2021-swin-14)</sup>.
- **Alternative pentru secvențe lungi:**
  - **Mamba** — modele selective de spații de stare (SSM) cu complexitate liniară<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — arhitectură de tip RNN cu antrenare paralelă și complexitate liniară a inferenței<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-peng2023-rwkv-16)</sup>.
  - **Hibride** (de ex., **Jamba**): alternează blocuri Transformer și Mamba; uneori completate cu MoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-lieber2024-jamba-17)</sup>.

## Tehnici de antrenare și optimizare

Eficiența Transformer este strâns legată de tehnica de antrenare și de infrastructură.

- **Strategii de pre-antrenare:** CLM și MLM; de asemenea obiective contrastive și de denoising (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-raffel2019-12)</sup>.
- **Tehnici de fine-tuning:**
  - **Fine-tuning complet** al tuturor parametrilor.
  - **Fine-tuning eficient din punct de vedere parametric (PEFT):** **LoRA** introduce adaptoare de rang scăzut cu greutățile de bază înghețate<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-hu2021-lora-18)</sup>.
- **Alinierea comportamentului:** **RLHF** — Reinforcement Learning cu feedback uman<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-ouyang2022-rlhf-19)</sup>.
- **Optimizări sistemice ale inferenței:** **PagedAttention/vLLM** cresc debitul de servire prin gestionarea paginată a cache-ului KV; deosebit de utilă pentru secvențe lungi și batch-uri mari<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_note-kwon2023-vllm-20)</sup>.

## Referințe

- The Illustrated Transformer — explicație vizuală a arhitecturii Transformer

## Bibliografie

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## Note

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_(RO)#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
