---
title: "Transformer-architectuur"
source: "https://systems-analysis.info/int/Transformer-architectuur"
wiki: "systems-analysis.info/int"
article: "Transformer-architectuur"
language: "nl"
categories:
  - "Category:Core LLM concepts"
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8246
wiki_created_at: 2026-09-07T01:14:29Z
wiki_modified_at: 2026-09-07T01:14:29Z
downloaded_at: 2026-09-07T23:24:17Z
---

# Transformer-architectuur

**De Transformer-architectuur** is een neurale netwerkarchitectuur die in 2017 werd gepresenteerd door onderzoekers van Google in het artikel «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>. Het zorgde voor een revolutie op het gebied van natuurlijke taalverwerking (NLP) en vormt de basis voor de meeste moderne grote taalmodellen (LLM), zoals BERT, GPT en Gemini. De belangrijkste innovatie van de Transformer is het mechanisme van **zelfaandacht (self‑attention)**, waarmee het model het belang van verschillende delen van de invoer kan afwegen en reeksen parallel kan verwerken, zonder gebruik te maken van de recurrentie die kenmerkend is voor RNN en LSTM.

## Historische context en achtergrond

Vóór 2017 waren recurrente neurale netwerken (RNN) en hun verbeterde variant — netwerken met lange kortetermijngeheugen (LSTM) — de dominante architecturen voor de verwerking van sequentiële gegevens, zoals tekst.

### Problemen van RNN/LSTM die door de Transformer worden aangepakt

- **Beperkingen van sequentiële verwerking:** RNN en LSTM verwerken gegevens token voor token, wat intra-sequentiële parallellisering uitsluit en het trainen op grote hoeveelheden gegevens vertraagt.
- **Het probleem van verdwijnende en exploderende gradiënten:** In lange reeksen kunnen gradiënten die over vele stappen terug worden gepropageerd, ofwel wegvallen ofwel exploderen, waardoor het leren van langetermijnafhankelijkheden wordt bemoeilijkt.
- **Langetermijnafhankelijkheden:** Informatie uit het begin van een reeks kan verloren gaan aan het einde ervan.

De Transformer-aanpak is een **volledige afwijzing van recurrentie** ten gunste van het aandachtsmechanisme. Het zorgt voor een **constante padlengte van afhankelijkheden** tussen willekeurige posities ($O(1)$), wat het modelleren van verafgelegen afhankelijkheden vergemakkelijkt, hoewel de basisimplementatie van self‑attention een **kwadratische rekenkundige complexiteit** heeft ten opzichte van de reekslengte ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-tay2020-2)</sup>. Het probleem van verdwijnende/exploderende gradiënten «verdwijnt» niet, maar wordt **verzacht** door residuele verbindingen, LayerNorm en de trainingsmodus; moderne implementaties maken vaak gebruik van de variant **Pre‑LayerNorm (Pre‑LN)** als stabieler tijdens het trainen<sup>[\[3\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-xiong2020-3)</sup>.

## Architectuur en belangrijkste componenten

De originele Transformer-architectuur bestaat uit twee hoofdonderdelen: de **encoder** en de **decoder**. Beide componenten zijn stapels van identieke lagen ($N = 6$ in het originele artikel)<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>.

- **Structuur van de encoderlaag:** (1) multi-head self‑attention (MHA), (2) positiegewijs FFN; elke sublaag is omgeven door een residuele verbinding en LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>.
- **Structuur van de decoderlaag:** (1) **gemaskeerde** self‑attention (causaal masker verbiedt toegang tot toekomstige posities), (2) **cross‑attention** naar de uitvoer van de encoder, (3) FFN — ook met residualen en LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>.

### Aandachtsmechanisme en Self‑Attention

Het aandachtsmechanisme berekent een gewogen sommatie van waardevectoren (Value), waarbij de gewichten worden bepaald door de mate van compatibiliteit van de sleutels (Key) met de zoekopdrachten (Query). De Transformer maakt gebruik van **geschaald scalair productaandacht (Scaled Dot‑Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Waar $d_{k}$ de dimensie is van de sleutels/zoekopdrachten; deling door $\sqrt{d_{k}}$ voorkomt verzadiging van softmax<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>. Wanneer $Q$, $K$ en $V$ worden gegenereerd door dezelfde reeks, wordt het mechanisme **self‑attention** genoemd.

### Multi‑Head Attention (meerhoofdige aandacht)

In plaats van één set matrices $(W_{Q},W_{K},W_{V})$ worden $h$ parallelle «hoofden» gebruikt, die elk $Q,K,V$ projecteren naar deelruimten met een kleinere dimensie, onafhankelijk aandacht berekenen, waarna de resultaten worden samengevoegd en geprojecteerd<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Varianten voor snellere inferentie:**

- **MQA (Multi‑Query Attention):** alle hoofden delen één sleutel/waarde → het volume en het verkeer van de KV‑cache bij decodering worden aanzienlijk verminderd<sup>[\[4\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** een compromis tussen MHA en MQA — meerdere groepen hoofden delen K/V; de kwaliteit ligt dicht bij MHA bij de snelheid van MQA<sup>[\[5\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-ainslie2023-5)</sup>.

### Positionele codering (Positional Encoding)

Omdat self‑attention invariant is ten opzichte van de volgorde van tokens, worden **positionele coderingen** toegevoegd aan de invoer-embeddings.

- **Originele sinusvormige coderingen** (PE) uit<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Moderne relatieve/roterende varianten:**
  - **RoPE (Rotary Position Embeddings)** codeert relatieve verschuivingen via rotatie van de vectoren $Q$/$K$; wordt toegepast in een aantal moderne LLM<sup>[\[6\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-su2021-6)</sup>.
  - **ALiBi** introduceert een lineaire straf in de aandachtsscores, wat de extrapolatie naar lengtes die groter zijn dan de trainingslengte verbetert<sup>[\[7\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-press2021-7)</sup>.

### Positiegewijze FFN, residualen en normalisatie

Elke encoder- en decoderlaag bevat, naast aandacht, een **positiegewijs FFN**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Rond elke sublaag worden **residuele verbindingen (residual connections)** en **Layer Normalization** gebruikt: ${LayerNorm}(x + {Sublayer}(x))$. In het origineel werd de variant **Post‑LN** toegepast<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>; moderne LLM gebruiken vaak **Pre‑LN** voor betere trainingsstabiliteit en minder afhankelijkheid van langdurige warm‑up<sup>[\[3\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-xiong2020-3)</sup>.

## Evolutie en moderne varianten

Vroege methoden die gebaseerd waren op recurrente neurale netwerken (RNN) en hun geavanceerde varianten, zoals LSTM, verwerkten tekst sequentieel, één token per keer. Hoewel deze aanpak intuïtief overeenkwam met de structuur van taal, creëerde het een aanzienlijke beperking: het bemoeilijkte parallelle berekeningen en maakte het moeilijker om afhankelijkheden te detecteren tussen elementen die ver van elkaar verwijderd waren in de tekst. In 2017 presenteerde een groep onderzoekers van Google een artikel getiteld «Attention Is All You Need». Daarin beschreven zij een nieuwe architectuur — de «Transformer». Dit model was de eerste dat volledig afzag van het gebruik van recurrente neurale netwerken en deze verving door een «aandachts»mechanisme (attention). De belangrijkste vernieuwing was dat het aandachtsmechanisme de Transformer in staat stelde het belang van elk woord in de invoerreeks te beoordelen bij het genereren van het bijbehorende woord in de uitvoer. Daarbij kon het model alle woorden tegelijkertijd verwerken. Dit vermogen tot parallelle verwerking maakte het mogelijk om veel grotere modellen te trainen op enorme hoeveelheden data. Het resultaat waren moderne grote taalmodellen (LLM).

De Transformer-architectuur diende als basis voor talrijke modellen, die grofweg in drie klassen worden ingedeeld.

### 1. Alleen-encoder modellen (Encoder‑only)

- **Voorbeeld:** BERT (en RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-devlin2019-8)</sup>.
- **Principe:** voortraining via de taak van **gemaskeerd taalmodellering (MLM)** met bidirectionele context.
- **Toepassing:** begripstaken (classificatie, NER enz.).

### 2. Alleen-decoder modellen (Decoder‑only)

- **Voorbeeld:** de GPT-serie (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-llama2023-11)</sup>, Claude.
- **Principe:** **causaal taalmodellering (CLM)** — voorspelling van het volgende token; het causale masker wordt toegepast op de aandacht<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>.
- **Toepassing:** tekstgeneratie, dialogen, code.

### 3. Encoder‑decoder modellen (Encoder‑decoder)

- **Voorbeeld:** de originele Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-raffel2019-12)</sup>.
- **Principe:** de encoder bouwt een representatie van de invoer op, de decoder genereert de uitvoer en maakt gebruik van cross‑attention naar de kenmerken van de encoder<sup>[\[1\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-vaswani2017-1)</sup>.
- **Toepassing:** seq2seq-taken (vertaling, samenvatting enz.).

### 4. Multimodale en alternatieve architecturen

- **Vision Transformer (ViT)** — aanpassing voor afbeeldingen (opdeling in patches)<sup>[\[13\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — hiërarchisch model met *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-liu2021-swin-14)</sup>.
- **Alternatieven voor lange reeksen:**
  - **Mamba** — selectieve toestandsruimtemodellen (SSM) met lineaire complexiteit<sup>[\[15\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — RNN-achtige architectuur met parallel trainen en lineaire inferentiecomplexiteit<sup>[\[16\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-peng2023-rwkv-16)</sup>.
  - **Hybriden** (bijv. **Jamba**): wisselen Transformer- en Mamba-blokken af; soms aangevuld met MoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-lieber2024-jamba-17)</sup>.

## Trainingstechnieken en optimalisatie

De effectiviteit van de Transformer hangt nauw samen met de trainingstechniek en de infrastructuur.

- **Strategieën voor voortraining:** CLM en MLM; ook contrastieve en denoising-doelstellingen (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-raffel2019-12)</sup>.
- **Technieken voor fine-tuning:**
  - **Volledig fine-tunen** van alle parameters.
  - **Parameterefficiënt fine-tunen (PEFT):** **LoRA** introduceert laagrangadapters bij bevroren basisgewichten<sup>[\[18\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-hu2021-lora-18)</sup>.
- **Gedragsafstemming:** **RLHF** — Reinforcement Learning op basis van menselijke feedback<sup>[\[19\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-ouyang2022-rlhf-19)</sup>.
- **Systeemoptimalisaties voor inferentie:** **PagedAttention/vLLM** verhogen de serverdoorvoer door middel van gepagineerd beheer van de KV‑cache; bijzonder nuttig bij lange reeksen en grote batches<sup>[\[20\]](https://systems-analysis.info/int/Transformer-architectuur#cite_note-kwon2023-vllm-20)</sup>.

## Verwijzingen

- The Illustrated Transformer — visuele uitleg van de Transformer-architectuur

## Literatuur

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## Noten

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer-architectuur#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
