---
title: "Transformer-arkitektur"
source: "https://systems-analysis.info/int/Transformer-arkitektur"
wiki: "systems-analysis.info/int"
article: "Transformer-arkitektur"
language: "sv"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 8247
wiki_created_at: 2026-09-07T01:14:30Z
wiki_modified_at: 2026-09-07T01:14:30Z
downloaded_at: 2026-09-07T23:24:18Z
---

# Transformer-arkitektur

**Transformer-arkitektur** — en arkitektur för neurala nätverk som presenterades 2017 av forskare vid Google i artikeln «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>. Den revolutionerade området för naturlig språkbehandling (NLP) och blev grunden för de flesta moderna stora språkmodeller (LLM), såsom BERT, GPT och Gemini. Den viktigaste innovationen i Transformer är mekanismen **self‑attention**, som gör det möjligt för modellen att vikta vikten av olika delar av indata och bearbeta sekvenser parallellt, utan den rekurrens som är typisk för RNN och LSTM.

## Historisk kontext och förutsättningar

Före 2017 dominerade rekurrenta neurala nätverk (RNN) och deras förbättrade variant — nätverk med lång korttidsminne (LSTM) — som arkitekturer för bearbetning av sekventiella data, såsom text.

### Problem med RNN/LSTM som Transformer adresserar

- **Begränsningar med sekventiell bearbetning:** RNN och LSTM bearbetar data token för token, vilket utesluter inomsekventiell parallellism och saktar ned träning på stora datamängder.
- **Problemet med försvinnande och exploderande gradienter:** I långa sekvenser kan gradienter som propageras bakåt genom många steg antingen avta eller växa, vilket försvårar inlärning av långsiktiga beroenden.
- **Långsiktiga beroenden:** Information från början av en sekvens kan gå förlorad mot dess slut.

Transformers tillvägagångssätt är ett **fullständigt övergivande av rekurrens** till förmån för uppmärksamhetsmekanismen. Det säkerställer en **konstant beroendeavstånd** mellan godtyckliga positioner ($O(1)$), vilket underlättar modellering av långdistansberoenden, även om grundimplementationen av self‑attention har **kvadratisk beräkningskomplexitet** med avseende på sekvenslängden ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-tay2020-2)</sup>. Problemet med avtagande/exploderande gradienter «försvinner» inte, utan **mildras** tack vare residualkopplingar, LayerNorm och träningsregimen; i moderna implementationer används ofta varianten **Pre‑LayerNorm (Pre‑LN)** som mer stabil under träning<sup>[\[3\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-xiong2020-3)</sup>.

## Arkitektur och nyckelkomponenter

Den ursprungliga Transformer-arkitekturen består av två huvuddelar: **enkodaren** och **dekodaren**. Båda komponenterna är staplar av identiska lager ($N = 6$ i originalartikeln)<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>.

- **Enkodarlagrets struktur:** (1) multi-head self‑attention (MHA), (2) positionsvis FFN; varje underlager omges av en residualkoppling och LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>.
- **Dekodarlagrets struktur:** (1) **maskerat** self‑attention (kausal mask förbjuder åtkomst till framtida positioner), (2) **cross‑attention** mot enkodarens utgångar, (3) FFN — också med residualer och LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>.

### Uppmärksamhetsmekanismen och Self‑Attention

Uppmärksamhetsmekanismen beräknar en viktad summering av värdvektorer (Value), där vikterna bestäms av graden av kompatibilitet mellan nycklar (Key) och frågor (Query). I Transformer används **skalerat skalärproduktuppmärksamhet (Scaled Dot‑Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Där $d_{k}$ är dimensionen för nycklar/frågor; divisionen med $\sqrt{d_{k}}$ förhindrar softmax-mättnad<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>. När $Q$, $K$ och $V$ härstammar från samma sekvens kallas mekanismen **self‑attention**.

### Multi‑Head Attention (flerhovsuppmärksamhet)

Istället för en enda uppsättning matriser $(W_{Q},W_{K},W_{V})$ används $h$ parallella «huvuden», där vart och ett projicerar $Q,K,V$ till underrum med lägre dimension, beräknar uppmärksamhet oberoende, varefter resultaten konkateneras och projiceras<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Varianter för snabbare inferens:**

- **MQA (Multi‑Query Attention):** alla huvuden delar en nyckel/ett värde → minskar avsevärt storleken och trafiken i KV‑cache vid avkodning<sup>[\[4\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** en kompromiss mellan MHA och MQA — flera grupper av huvuden delar K/V; kvaliteten är nära MHA vid MQA:s hastighet<sup>[\[5\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-ainslie2023-5)</sup>.

### Positionskodning (Positional Encoding)

Eftersom self‑attention är invariant mot tokenordning läggs **positionskodningar** till inmatningsembeddings.

- **Ursprungliga sinusformade kodningar** (PE) från<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Moderna relativa/rotations-varianter:**
  - **RoPE (Rotary Position Embeddings)** kodar relativa förskjutningar genom rotation av vektorerna $Q$/$K$; används i flera moderna LLM<sup>[\[6\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-su2021-6)</sup>.
  - **ALiBi** inför ett linjärt straff i uppmärksamhetspoängen, vilket förbättrar extrapolering till längder som överstiger träningslängder<sup>[\[7\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-press2021-7)</sup>.

### Positionsvisa FFN, residualer och normalisering

Varje enkodar- och dekodarskikt innehåller, utöver uppmärksamhet, en **positionsvis FFN**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Runt varje underlager används **residualkopplingar (residual connections)** och **Layer Normalization**: ${LayerNorm}(x + {Sublayer}(x))$. I originalet användes varianten **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>; i moderna LLM används ofta **Pre‑LN** för bättre träningsstabilitet och mindre beroende av lång warm‑up<sup>[\[3\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-xiong2020-3)</sup>.

## Utveckling och moderna varianter

Tidiga metoder baserade på rekurrenta neurala nätverk (RNN) och deras avancerade varianter, såsom LSTM, bearbetade text sekventiellt, ett token i taget. Även om detta tillvägagångssätt intuitivt motsvarade språkets struktur, skapade det en betydande begränsning: det försvårade parallella beräkningar och komplicerade identifieringen av beroenden mellan element som befann sig långt från varandra i texten. År 2017 presenterade en grupp forskare från Google en artikel med titeln «Attention Is All You Need». I den beskrev de en ny arkitektur — «Transformer». Denna modell övergav för första gången helt användningen av rekurrenta neurala nätverk och ersatte dem med en «uppmärksamhets»-mekanism (attention). Det viktigaste nyskapandet var att uppmärksamhetsmekanismen gjorde det möjligt för Transformer att bedöma vikten av varje ord i inmatningssekvensen för att generera motsvarande ord i utmatningen. Samtidigt kunde modellen bearbeta alla ord samtidigt. Denna förmåga till parallell bearbetning möjliggjorde träning av betydligt större modeller på enorma datamängder. Som ett resultat uppstod moderna stora språkmodeller (LLM).

Transformer-arkitekturen utgjorde grunden för ett flertal modeller, som grovt kan delas in i tre klasser.

### 1. Enkodar-only-modeller (Encoder‑only)

- **Exempel:** BERT (samt RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-devlin2019-8)</sup>.
- **Princip:** förträning med uppgiften **maskerad språkmodellering (MLM)** med dubbelriktat sammanhang.
- **Tillämpning:** förståelseuppgifter (klassificering, NER m.m.).

### 2. Dekodar-only-modeller (Decoder‑only)

- **Exempel:** GPT-serien (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-llama2023-11)</sup>, Claude.
- **Princip:** **kausal språkmodellering (CLM)** — förutsägelse av nästa token; en kausal mask appliceras på uppmärksamheten<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>.
- **Tillämpning:** textgenerering, dialoger, kod.

### 3. Enkodar-dekodar-modeller (Encoder‑decoder)

- **Exempel:** den ursprungliga Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-raffel2019-12)</sup>.
- **Princip:** enkodaren bygger en representation av indata, dekodaren genererar utdata och använder cross‑attention mot enkodarens egenskaper<sup>[\[1\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-vaswani2017-1)</sup>.
- **Tillämpning:** seq2seq-uppgifter (översättning, sammanfattning m.m.).

### 4. Multimodala och alternativa arkitekturer

- **Vision Transformer (ViT)** — anpassning för bilder (uppdelning i patchar)<sup>[\[13\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — en hierarkisk modell med *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-liu2021-swin-14)</sup>.
- **Alternativ för långa sekvenser:**
  - **Mamba** — selektiva tillståndsrumsmodeller (SSM) med linjär komplexitet<sup>[\[15\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — en RNN-liknande arkitektur med parallell träning och linjär inferenskomplexitet<sup>[\[16\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-peng2023-rwkv-16)</sup>.
  - **Hybrider** (t.ex. **Jamba**): alternar Transformer- och Mamba-block; kombineras ibland med MoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-lieber2024-jamba-17)</sup>.

## Träningstekniker och optimering

Transformers effektivitet är nära kopplad till träningstekniken och infrastrukturen.

- **Förträningsstrategier:** CLM och MLM; även kontrastiva och brusreducerande mål (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-raffel2019-12)</sup>.
- **Tekniker för fine‑tuning:**
  - **Fullständig fine‑tuning** av alla parametrar.
  - **Parametereffektiv fine‑tuning (PEFT):** **LoRA** introducerar lågrangsadaptrar med frusna grundvikter<sup>[\[18\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-hu2021-lora-18)</sup>.
- **Beteendeanpassning:** **RLHF** — Reinforcement Learning från mänsklig återkoppling<sup>[\[19\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-ouyang2022-rlhf-19)</sup>.
- **Systemoptimeringar för inferens:** **PagedAttention/vLLM** ökar serveringsthroughput genom sidhantering av KV‑cache; särskilt fördelaktigt vid långa sekvenser och stora batchar<sup>[\[20\]](https://systems-analysis.info/int/Transformer-arkitektur#cite_note-kwon2023-vllm-20)</sup>.

## Länkar

- The Illustrated Transformer — visuell förklaring av Transformer-arkitekturen

## Litteratur

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## Noter

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer-arkitektur#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
