---
title: "Architecture Transformer"
source: "https://systems-analysis.info/int/Architecture_Transformer"
wiki: "systems-analysis.info/int"
article: "Architecture_Transformer"
language: "fr"
categories:
  - "Category:French"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 430
wiki_created_at: 2026-09-06T22:33:37Z
wiki_modified_at: 2026-09-06T22:33:37Z
downloaded_at: 2026-09-07T22:39:57Z
---

# Architecture Transformer

L'***architecture Transformer** est une architecture de réseau de neurones présentée en 2017 par des chercheurs de Google dans l'article « Attention Is All You Need »<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup>. Elle a révolutionné le domaine du traitement du langage naturel (TALN, ou NLP en anglais) et est devenue la base de la plupart des [grands modèles de langage](https://systems-analysis.info/int/Grands_mod%C3%A8les_de_langage "Grands modèles de langage") (LLM) modernes, tels que BERT, GPT et Gemini. L'innovation clé du Transformer est le mécanisme d'***auto-attention (self‑attention)**, qui permet au modèle de pondérer l'importance des différentes parties des données d'entrée et de traiter les séquences en parallèle, abandonnant ainsi la récurrence propre aux RNN et aux LSTM.

## Contexte historique et prérequis

Avant 2017, les architectures dominantes pour le traitement des données séquentielles, comme le texte, étaient les réseaux de neurones récurrents (RNN) et leur variante améliorée, les réseaux à mémoire longue à court terme (LSTM).

### Problèmes des RNN/LSTM abordés par le Transformer

- **Limitations du traitement séquentiel :** Les RNN et les LSTM traitent les données jeton par jeton, ce qui exclut le parallélisme intra-séquence et ralentit l'entraînement sur de grands volumes de données.
- **Problème de la disparition et de l'explosion des gradients :** Dans les séquences longues, les gradients propagés en arrière à travers de nombreuses étapes peuvent soit s'annuler (disparaître), soit croître de manière exponentielle (exploser), ce qui complique l'apprentissage des dépendances à long terme.
- **Dépendances à long terme :** L'information provenant du début d'une séquence peut se perdre avant d'atteindre la fin.

L'approche du Transformer consiste en un **abandon complet de la récurrence** au profit d'un mécanisme d'attention. Il garantit une **longueur de chemin constante pour les dépendances** entre n'importe quelles positions ($O(1)$), ce qui facilite la modélisation des dépendances à longue portée, bien que l'implémentation de base de l'auto-attention ait une **complexité de calcul quadratique** par rapport à la longueur de la séquence ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-tay2020-2)</sup>. Le problème de la disparition/explosion des gradients n'est pas « éliminé », mais **atténué** grâce aux connexions résiduelles, à la LayerNorm et au régime d'entraînement ; les implémentations modernes utilisent souvent la variante **Pre‑LayerNorm (Pre‑LN)**, plus stable lors de l'entraînement<sup>[\[3\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-xiong2020-3)</sup>.

## Architecture et composants clés

L'architecture originale du Transformer se compose de deux parties principales : un **encodeur** et un **décodeur**. Les deux composants sont des piles de couches identiques ($N = 6$ dans l'article original)<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup>.

- **Structure d'une couche d'encodeur :** (1) auto-attention multi-têtes (MHA), (2) réseau de neurones à propagation avant positionnel (FFN) ; chaque sous-couche est entourée d'une connexion résiduelle et d'une LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup>.
- **Structure d'une couche de décodeur :** (1) auto-attention **masquée** (un masque causal empêche l'accès aux positions futures), (2) **attention croisée (cross‑attention)** avec les sorties de l'encodeur, (3) FFN — également avec des connexions résiduelles et une LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup>.

### Mécanisme d'attention et Self-Attention

Le mécanisme d'attention calcule une somme pondérée des vecteurs de valeur (Value), où les poids sont déterminés par le degré de compatibilité des clés (Key) avec les requêtes (Query). Le Transformer utilise une **attention par produit scalaire mis à l'échelle (Scaled Dot‑Product Attention)** :

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Où $d_{k}$ est la dimension des clés/requêtes ; la division par $\sqrt{d_{k}}$ empêche la saturation de la fonction softmax<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup>. Lorsque $Q$, $K$ et $V$ sont générés à partir de la même séquence, le mécanisme est appelé **auto-attention (self‑attention)**.

### Multi‑Head Attention (attention multi-têtes)

Au lieu d'un seul ensemble de matrices $(W_{Q},W_{K},W_{V})$, on utilise $h$ « têtes » parallèles, chacune projetant $Q,K,V$ dans des sous-espaces de plus petite dimension, calculant l'attention indépendamment, puis les résultats sont concaténés et projetés<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup> :

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{où~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Variantes pour accélérer l'inférence :**

- **MQA (Multi‑Query Attention) :** toutes les têtes partagent une seule clé/valeur → réduit considérablement le volume et le trafic du cache KV lors du décodage<sup>[\[4\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention) :** un compromis entre MHA et MQA — plusieurs groupes de têtes partagent K/V ; la qualité est proche de celle du MHA avec la vitesse du MQA<sup>[\[5\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-ainslie2023-5)</sup>.

### Encodage de position (Positional Encoding)

Comme l'auto-attention est invariante à l'ordre des jetons, des **encodages de position** sont ajoutés aux embeddings d'entrée.

- **Encodages sinusoïdaux originaux** (PE) de <sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup> :

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Variantes relatives/rotatives modernes :**
  - **RoPE (Rotary Position Embeddings)** encode les décalages relatifs par la rotation des vecteurs $Q$/$K$ ; utilisé dans plusieurs LLM modernes<sup>[\[6\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-su2021-6)</sup>.
  - **ALiBi** introduit une pénalité linéaire dans les scores d'attention, ce qui améliore l'extrapolation à des longueurs supérieures à celles vues à l'entraînement<sup>[\[7\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-press2021-7)</sup>.

### FFN, connexions résiduelles et normalisation

Chaque couche de l'encodeur et du décodeur, en plus de l'attention, contient un **réseau de neurones à propagation avant positionnel (FFN)** :

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Autour de chaque sous-couche sont utilisées des **connexions résiduelles (residual connections)** et une **normalisation de couche (Layer Normalization)** : ${LayerNorm}(x + {Sublayer}(x))$. L'original utilisait la variante **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup> ; les LLM modernes utilisent souvent la **Pre‑LN** pour une meilleure stabilité d'entraînement et une moindre dépendance à un long *warm-up*<sup>[\[3\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-xiong2020-3)</sup>.

## Évolution et variantes modernes

Les premières méthodes, basées sur les réseaux de neurones récurrents (RNN) et leurs variantes avancées comme les LSTM, traitaient le texte séquentiellement, un jeton à la fois. Bien que cette approche corresponde intuitivement à la structure du langage, elle imposait une contrainte majeure : elle rendait les calculs parallèles difficiles et compliquait la détection des dépendances entre des éléments éloignés dans le texte. En 2017, un groupe de chercheurs de Google a présenté un article intitulé « Attention Is All You Need ». Ils y décrivaient une nouvelle architecture : le « Transformer ». Ce modèle a été le premier à abandonner complètement l'utilisation des réseaux de neurones récurrents, les remplaçant par un mécanisme d'« attention ». L'innovation principale résidait dans le fait que le mécanisme d'attention permettait au Transformer d'évaluer l'importance de chaque mot dans la séquence d'entrée pour générer le mot correspondant en sortie. De plus, le modèle pouvait traiter tous les mots simultanément. Cette capacité de traitement parallèle a rendu possible l'entraînement de modèles beaucoup plus grands sur d'énormes volumes de données, ce qui a conduit à l'émergence des grands modèles de langage (LLM) modernes.

L'architecture Transformer a servi de base à de nombreux modèles, que l'on peut classer en trois catégories.

### 1. Modèles à encodeur seul (Encoder-only)

- **Exemple :** BERT (et RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-devlin2019-8)</sup>.
- **Principe :** pré-entraînement sur une tâche de **modélisation du langage masqué (MLM)** avec un contexte bidirectionnel.
- **Application :** tâches de compréhension (classification, NER, etc.).

### 2. Modèles à décodeur seul (Decoder-only)

- **Exemple :** la série GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-llama2023-11)</sup>, Claude.
- **Principe :** **modélisation du langage causal (CLM)** — prédiction du jeton suivant ; un masque causal est appliqué à l'attention<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup>.
- **Application :** génération de texte, dialogues, code.

### 3. Modèles encodeur-décodeur (Encoder-decoder)

- **Exemple :** le Transformer original, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-raffel2019-12)</sup>.
- **Principe :** l'encodeur construit une représentation de l'entrée, le décodeur génère la sortie et utilise une attention croisée (cross-attention) sur les caractéristiques de l'encodeur<sup>[\[1\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-vaswani2017-1)</sup>.
- **Application :** tâches de séquence à séquence (seq2seq) (traduction, résumé, etc.).

### 4. Architectures multimodales et alternatives

- **Vision Transformer (ViT)** — adaptation aux images (division en patchs)<sup>[\[13\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-dosovitskiy2020-13)</sup> ; **Swin Transformer** — un modèle hiérarchique avec des *fenêtres décalées (shifted windows)*<sup>[\[14\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-liu2021-swin-14)</sup>.
- **Alternatives pour les séquences longues :**
  - **Mamba** — modèles sélectifs à espace d'états (SSM) avec une complexité linéaire<sup>[\[15\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — une architecture de type RNN avec un entraînement parallèle et une complexité d'inférence linéaire<sup>[\[16\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-peng2023-rwkv-16)</sup>.
  - **Hybrides** (par ex., **Jamba**) : alternent des blocs Transformer et Mamba ; parfois complétés par un MoE<sup>[\[17\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-lieber2024-jamba-17)</sup>.

## Techniques d'entraînement et d'optimisation

L'efficacité du Transformer est étroitement liée aux techniques d'entraînement et à l'infrastructure.

- **Stratégies de pré-entraînement :** CLM et MLM ; également des objectifs contrastifs et de débruitage (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-raffel2019-12)</sup>.
- **Techniques de fine-tuning (Fine‑tuning) :**
  - **Fine-tuning complet** de tous les paramètres.
  - **Fine-tuning efficace en paramètres (PEFT) :** **LoRA** introduit des adaptateurs de bas rang tandis que les poids du modèle de base sont gelés<sup>[\[18\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-hu2021-lora-18)</sup>.
- **Alignement du comportement :** **RLHF** — apprentissage par renforcement à partir de retours humains<sup>[\[19\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-ouyang2022-rlhf-19)</sup>.
- **Optimisations système pour l'inférence :** **PagedAttention/vLLM** augmentent le débit du service (serving) grâce à une gestion paginée du cache KV ; particulièrement utile pour les séquences longues et les grands lots (batches)<sup>[\[20\]](https://systems-analysis.info/int/Architecture_Transformer#cite_note-kwon2023-vllm-20)</sup>.

## Liens externes

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external text" rel="nofollow">The Illustrated Transformer — explication visuelle de l'architecture Transformer</a>

## Bibliographie

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. <a href="https://arxiv.org/abs/2010.11929" class="external text" rel="nofollow">arXiv:2010.11929</a>.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. <a href="https://arxiv.org/abs/2103.14030" class="external text" rel="nofollow">arXiv:2103.14030</a>.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. <a href="https://arxiv.org/abs/2009.06732" class="external text" rel="nofollow">arXiv:2009.06732</a>.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. <a href="https://arxiv.org/abs/2002.04745" class="external text" rel="nofollow">arXiv:2002.04745</a>.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). <a href="https://arxiv.org/abs/1911.02150" class="external text" rel="nofollow">arXiv:1911.02150</a>.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. <a href="https://arxiv.org/abs/2305.13048" class="external text" rel="nofollow">arXiv:2305.13048</a>.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. <a href="https://openreview.net/forum?id=TG8KACxEON" class="external text" rel="nofollow">OpenReview</a>.

## Références

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Architecture_Transformer#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
