---
title: "Transformer Mimarisi"
source: "https://systems-analysis.info/int/Transformer_Mimarisi"
wiki: "systems-analysis.info/int"
article: "Transformer_Mimarisi"
language: "tr"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Turkish"
revision_id: 8248
wiki_created_at: 2026-09-07T01:14:31Z
wiki_modified_at: 2026-09-07T01:14:31Z
downloaded_at: 2026-09-07T23:24:18Z
---

# Transformer Mimarisi

**Transformer Mimarisi** — 2017 yılında Google araştırmacıları tarafından «Attention Is All You Need» adlı makalede<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup> tanıtılan bir sinir ağı mimarisidir. Bu mimari, doğal dil işleme (NLP) alanında devrim yaratmış ve BERT, GPT ile Gemini gibi modern büyük dil modellerinin (LLM) büyük çoğunluğunun temelini oluşturmuştur. Transformer'ın temel yeniliği, modelin girdi verilerinin farklı bölümlerinin önemini ağırlıklandırmasına ve RNN ile LSTM'ye özgü yinelemeli yapıdan vazgeçerek dizileri paralel olarak işlemesine olanak tanıyan **öz-dikkat (self‑attention)** mekanizmasıdır.

## Tarihsel Bağlam ve Ön Koşullar

2017 yılından önce, metin gibi sıralı verileri işlemek için baskın mimariler yinelemeli sinir ağları (RNN) ve bunların geliştirilmiş versiyonu olan uzun kısa süreli bellek (LSTM) ağlarıydı.

### RNN/LSTM'nin Transformer Tarafından Ele Alınan Sorunları

- **Sıralı işlemenin kısıtlamaları:** RNN ve LSTM verileri token token işler; bu durum dizi içi paralelizmi engeller ve büyük veri hacimlerinde eğitimi yavaşlatır.
- **Kaybolan ve patlayan gradyan sorunu:** Uzun dizilerde çok sayıda adım boyunca geri yayılan gradyanlar ya sönümlenebilir ya da büyüyebilir; bu da uzun vadeli bağımlılıkların öğrenilmesini zorlaştırır.
- **Uzun vadeli bağımlılıklar:** Dizinin başındaki bilgi, sonuna gelindiğinde kaybolabilir.

Transformer'ın yaklaşımı, dikkat mekanizması lehine **yinelemelilikten tam anlamıyla vazgeçmektir**. Bu yaklaşım, herhangi iki konum arasında ($O(1)$) **sabit uzunlukta bağımlılık yolu** sağlar; bu da uzak mesafeli bağımlılıkların modellenmesini kolaylaştırır; bununla birlikte öz-dikkat mekanizmasının temel uygulaması dizi uzunluğuna göre **ikinci dereceden hesaplama karmaşıklığına** sahiptir ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-tay2020-2)</sup>. Gradyan sönümleme/patlama sorunu «ortadan kalkmaz», artık kalıntı bağlantılar (residual connections), LayerNorm ve eğitim düzeni sayesinde **hafifletilir**; modern uygulamalarda eğitim sırasında daha kararlı bir davranış sergilediği için çoğunlukla **Pre‑LayerNorm (Pre‑LN)** varyantı tercih edilir<sup>[\[3\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-xiong2020-3)</sup>.

## Mimari ve Temel Bileşenler

Orijinal Transformer mimarisi iki ana bölümden oluşur: **kodlayıcı (encoder)** ve **çözücü (decoder)**. Her iki bileşen de özdeş katmanlardan oluşan yığınlardır (orijinal makalede $N = 6$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>.

- **Kodlayıcı katman yapısı:** (1) çok başlıklı öz-dikkat (MHA), (2) konuma özgü eleman bazlı FFN; her alt katman artık kalıntı bağlantı ve LayerNorm ile sarılıdır<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>.
- **Çözücü katman yapısı:** (1) **maskelenmiş** öz-dikkat (nedensel maske, gelecekteki konumlara erişimi engeller), (2) kodlayıcı çıktılarına **cross‑attention**, (3) FFN — kalıntı bağlantılar ve LayerNorm ile birlikte<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>.

### Dikkat Mekanizması ve Self‑Attention

Dikkat mekanizması, ağırlıkların Anahtar (Key) ile Sorgu (Query) arasındaki uyumluluk derecesiyle belirlendiği Değer (Value) vektörlerinin ağırlıklı toplamını hesaplar. Transformer'da **ölçeklendirilmiş nokta çarpımı dikkati (Scaled Dot‑Product Attention)** kullanılır:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Burada $d_{k}$, anahtar/sorgularının boyutudur; $\sqrt{d_{k}}$'ya bölme işlemi softmax'ın doygunlaşmasını önler<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>. $Q$, $K$ ve $V$ aynı diziden türetildiğinde bu mekanizma **öz-dikkat (self‑attention)** olarak adlandırılır.

### Multi‑Head Attention - Çok Başlıklı Dikkat

Tek bir $(W_{Q},W_{K},W_{V})$ matris kümesi yerine, her biri $Q,K,V$'yi daha küçük boyutlu alt uzaylara yansıtan, bağımsız olarak dikkat hesaplayan ve sonuçları birleştirerek yeniden yansıtan $h$ paralel «baş» kullanılır<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Çıkarım sürecini hızlandırmaya yönelik varyantlar:**

- **MQA (Multi‑Query Attention):** tüm başlar tek bir anahtar/değer paylaşır → kod çözme sırasında KV önbelleğinin boyutu ve trafiği önemli ölçüde azalır<sup>[\[4\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** MHA ile MQA arasında bir denge — birkaç baş grubu K/V paylaşır; MQA hızıyla MHA'ya yakın kalite elde edilir<sup>[\[5\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-ainslie2023-5)</sup>.

### Konumsal Kodlama (Positional Encoding)

Öz-dikkat token sırasına karşı değişmez olduğundan, girdi embedding'lerine **konumsal kodlamalar** eklenir.

- <sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>'deki **orijinal sinüzoidal kodlamalar** (PE):

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Modern göreli/dönel varyantlar:**
  - **RoPE (Rotary Position Embeddings)**, göreli kaymalar $Q$/$K$ vektörlerinin döndürülmesiyle kodlanır; bir dizi modern LLM'de kullanılır<sup>[\[6\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-su2021-6)</sup>.
  - **ALiBi**, dikkat puanlarına doğrusal bir ceza ekler; bu sayede eğitim sırasında görülenden daha uzun dizilere ekstrapolasyon iyileşir<sup>[\[7\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-press2021-7)</sup>.

### Eleman Bazlı FFN, Kalıntı Bağlantılar ve Normalizasyon

Her kodlayıcı ve çözücü katmanı, dikkat mekanizmasına ek olarak **konuma özgü eleman bazlı FFN** içerir:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Her alt katmanın etrafında **artık bağlantılar (residual connections)** ve **Layer Normalization** kullanılır: ${LayerNorm}(x + {Sublayer}(x))$. Orijinal çalışmada **Post‑LN** varyantı kullanılmıştır<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>; modern LLM'lerde ise daha iyi eğitim kararlılığı ve daha az uzun ısınma süresine bağımlılık sağladığı için genellikle **Pre‑LN** tercih edilir<sup>[\[3\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-xiong2020-3)</sup>.

## Evrim ve Modern Varyantlar

Yinelemeli sinir ağlarına (RNN) ve LSTM gibi gelişmiş varyantlarına dayanan erken yöntemler, metni sıralı biçimde, her seferinde bir token olarak işliyordu. Bu yaklaşım, dil yapısıyla sezgisel olarak örtüşse de ciddi bir kısıtlama yaratıyordu: paralel hesaplamayı zorlaştırıyor ve metinde birbirinden uzak konumdaki öğeler arasındaki bağımlılıkların saptanmasını güçleştiriyordu. 2017 yılında Google'dan bir araştırmacı grubu «Attention Is All You Need» başlıklı makaleyi yayımladı. Bu makalede «Transformer» adı verilen yeni bir mimari tanımladılar. Bu model, yinelemeli sinir ağlarının kullanımından tamamen vazgeçen ve bunların yerine «dikkat» (attention) mekanizmasını koyan ilk mimari oldu. Temel yenilik, dikkat mekanizmasının Transformer'ın her girdi dizisindeki kelimenin önemini, karşılık gelen çıktı kelimesini üretmek amacıyla değerlendirmesine olanak tanımasıydı; üstelik model tüm kelimeleri aynı anda işleyebiliyordu. Bu paralel işleme yeteneği, çok daha büyük modellerin devasa veri kümeleri üzerinde eğitilmesini mümkün kıldı. Sonuç olarak modern büyük dil modelleri (LLM) ortaya çıktı.

Transformer mimarisi, genel olarak üç sınıfa ayrılan çok sayıda modele temel oluşturmuştur.

### 1. Yalnızca Kodlayıcı Modeller (Encoder‑only)

- **Örnek:** BERT (ve RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-devlin2019-8)</sup>.
- **İlke:** çift yönlü bağlamla **maskelenmiş dil modelleme (MLM)** görevi üzerinde ön eğitim.
- **Kullanım alanı:** anlama görevleri (sınıflandırma, NER vb.).

### 2. Yalnızca Çözücü Modeller (Decoder‑only)

- **Örnek:** GPT serisi (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-llama2023-11)</sup>, Claude.
- **İlke:** **nedensel dil modelleme (CLM)** — bir sonraki token'ın tahmin edilmesi; dikkate nedensel maske uygulanır<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>.
- **Kullanım alanı:** metin üretme, diyalog, kod.

### 3. Kodlayıcı‑Çözücü Modeller (Encoder‑decoder)

- **Örnek:** orijinal Transformer, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-raffel2019-12)</sup>.
- **İlke:** kodlayıcı girdi temsilini oluşturur, çözücü çıktı üretir ve kodlayıcı özelliklerine cross‑attention uygular<sup>[\[1\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-vaswani2017-1)</sup>.
- **Kullanım alanı:** seq2seq görevleri (çeviri, özetleme vb.).

### 4. Çok Modlu ve Alternatif Mimariler

- **Vision Transformer (ViT)** — görüntülere uyarlama (yamalara bölme)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — *shifted windows* ile hiyerarşik model<sup>[\[14\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-liu2021-swin-14)</sup>.
- **Uzun diziler için alternatifler:**
  - **Mamba** — doğrusal karmaşıklıklı seçici durum uzayı modelleri (SSM)<sup>[\[15\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — paralel eğitim ve doğrusal çıkarım karmaşıklığına sahip RNN benzeri mimari<sup>[\[16\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-peng2023-rwkv-16)</sup>.
  - **Hibrit modeller** (örn. **Jamba**): Transformer ve Mamba bloklarını birbirini izleyerek kullanır; bazen MoE ile tamamlanır<sup>[\[17\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-lieber2024-jamba-17)</sup>.

## Eğitim Teknikleri ve Optimizasyon

Transformer'ın verimliliği, eğitim tekniği ve altyapıyla yakından ilişkilidir.

- **Ön eğitim stratejileri:** CLM ve MLM; ayrıca karşıtsal ve gürültü giderme hedefleri (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-raffel2019-12)</sup>.
- **Fine‑tuning teknikleri:**
  - Tüm parametreler üzerinde **tam fine‑tuning**.
  - **Parametrik açıdan verimli fine‑tuning (PEFT):** **LoRA**, temel ağırlıklar dondurulmuş halde düşük sıralı adaptörler ekler<sup>[\[18\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-hu2021-lora-18)</sup>.
- **Davranış hizalama:** **RLHF** — insan geri bildirimine dayalı pekiştirmeli öğrenme<sup>[\[19\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-ouyang2022-rlhf-19)</sup>.
- **Çıkarım sistemi optimizasyonları:** **PagedAttention/vLLM**, KV önbelleğinin sayfalı yönetimi aracılığıyla servis aktarım hızını artırır; özellikle uzun dizilerde ve büyük toplu işlemlerde faydalıdır<sup>[\[20\]](https://systems-analysis.info/int/Transformer_Mimarisi#cite_note-kwon2023-vllm-20)</sup>.

## Dış bağlantılar

- The Illustrated Transformer — Transformer mimarisinin görsel açıklaması

## Literatür

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## Notlar

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_Mimarisi#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
