---
title: "Transformer architecture — ארכיטקטורת Transformer"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_ארכיטקטורת_Transformer"
language: "he"
categories:
  - "Category:Core LLM concepts"
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8258
wiki_created_at: 2026-09-07T01:14:39Z
wiki_modified_at: 2026-09-07T01:14:39Z
downloaded_at: 2026-09-07T23:24:23Z
---

# Transformer architecture — ארכיטקטורת Transformer

**ארכיטקטורת Transformer** היא ארכיטקטורת רשת נוירונים שהוצגה בשנת 2017 על ידי חוקרי Google במאמר «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>. היא חוללה מהפכה בתחום עיבוד שפה טבעית (NLP) והפכה לבסיס עבור רוב מודלי השפה הגדולים (LLM) המודרניים, כגון BERT, GPT ו-Gemini. החידוש המרכזי של Transformer הוא מנגנון **תשומת הלב העצמית (self‑attention)**, המאפשר למודל לשקלל את חשיבות חלקים שונים של נתוני הקלט ולעבד רצפים באופן מקבילי, תוך ויתור על הרקורסיביות האופיינית ל-RNN ו-LSTM.

## ההקשר ההיסטורי והרקע

לפני שנת 2017, הארכיטקטורות הדומיננטיות לעיבוד נתונים רציפים, כגון טקסט, היו רשתות נוירונים רקורנטיות (RNN) וגרסתן המשופרת — רשתות זיכרון לטווח ארוך-קצר (LSTM).

### בעיות RNN/LSTM שהטרנספורמר מתמודד עמן

- **מגבלות עיבוד סדרתי:** RNN ו-LSTM מעבדות נתונים token אחר token, מה שמונע מקביליות בתוך הרצף ומאט את האימון על נפחי נתונים גדולים.
- **בעיית היעלמות והתפוצצות הגרדיאנט:** ברצפים ארוכים, גרדיאנטים המופצים אחורה דרך שלבים רבים עלולים לדעוך או לגדול, מה שמקשה על למידת תלויות לטווח ארוך.
- **תלויות לטווח ארוך:** מידע מתחילת הרצף עלול ללכת לאיבוד בסופו.

גישת Transformer היא **ויתור מוחלט על הרקורסיביות** לטובת מנגנון תשומת הלב. היא מבטיחה **אורך מסלול תלות קבוע** בין כל עמדה ($O(1)$), מה שמקל על מידול תלויות מרוחקות, אם כי המימוש הבסיסי של self-attention הוא בעל **מורכבות חישובית ריבועית** לפי אורך הרצף ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-tay2020-2)</sup>. בעיית דעיכה/התפוצצות הגרדיאנט אינה "נעלמת", אלא **מוקלת** באמצעות חיבורים שיוריים, LayerNorm ומשטר האימון; במימושים מודרניים נעשה שימוש תכוף בגרסת **Pre‑LayerNorm (Pre‑LN)** כיציבה יותר באימון<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-xiong2020-3)</sup>.

## הארכיטקטורה ורכיביה המרכזיים

ארכיטקטורת Transformer המקורית מורכבת משני חלקים עיקריים: **encoder** ו-**decoder**. שני הרכיבים הם ערימות של שכבות זהות ($N = 6$ במאמר המקורי)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>.

- **מבנה שכבת ה-encoder:** (1) Multi-Head Attention עצמי (MHA), (2) FFN פוזיציונלי-פר-אלמנטי; כל תת-שכבה מוקפת בחיבור שיורי ו-LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>.
- **מבנה שכבת ה-decoder:** (1) self-attention **מסוכך** (מסיכה קאוזלית אוסרת גישה לעמדות עתידיות), (2) **cross‑attention** לפלטי ה-encoder, (3) FFN — גם עם חיבורים שיוריים ו-LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>.

### מנגנון תשומת הלב ו-Self‑Attention

מנגנון תשומת הלב מחשב סכימה משוקללת של וקטורי ערך (Value), כאשר המשקלים נקבעים על פי מידת ההתאמה בין מפתחות (Key) לשאילתות (Query). ב-Transformer נעשה שימוש ב-**Scaled Dot‑Product Attention**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

כאשר $d_{k}$ הוא מימד המפתחות/שאילתות; החלוקה ב-$\sqrt{d_{k}}$ מונעת רוויה של softmax<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>. כאשר $Q$, $K$ ו-$V$ נוצרים מאותו הרצף, המנגנון נקרא **self‑attention**.

### Multi‑Head Attention (תשומת לב רב-ראשית)

במקום מערכת מטריצות אחת $(W_{Q},W_{K},W_{V})$, נעשה שימוש ב-$h$ "ראשים" מקבילים, שכל אחד מהם מקרין את $Q,K,V$ לתת-מרחבים בעלי מימד קטן יותר, מחשב תשומת לב באופן עצמאי, ולאחר מכן התוצאות מאוחדות ומוקרנות<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**גרסאות להאצת inference:**

- **MQA (Multi‑Query Attention):** כל הראשים חולקים מפתח/ערך אחד → מפחית משמעותית את נפח ותעבורת ה-KV cache בזמן פענוח<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** פשרה בין MHA ל-MQA — מספר קבוצות של ראשים חולקות K/V; האיכות קרובה ל-MHA במהירות של MQA<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-ainslie2023-5)</sup>.

### קידוד פוזיציונלי (Positional Encoding)

מכיוון ש-self-attention אינווריאנטי לסדר ה-token, מוסיפים ל-embedding הקלט **קידודים פוזיציונליים**.

- **קידודי סינוס מקוריים** (PE) מתוך<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **גרסאות יחסיות/רוטוריות מודרניות:**
  - **RoPE (Rotary Position Embeddings)** מקודד הזזות יחסיות באמצעות סיבוב וקטורי $Q$/$K$; משמש בחלק מה-LLM המודרניים<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-su2021-6)</sup>.
  - **ALiBi** מוסיף קנס לינארי לציוני תשומת הלב, מה שמשפר אקסטרפולציה לאורכים הגדולים מאלו שנראו באימון<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-press2021-7)</sup>.

### FFN פר-אלמנטי, חיבורים שיוריים ונרמול

כל שכבה של encoder ו-decoder, בנוסף לתשומת הלב, מכילה **FFN פוזיציונלי-פר-אלמנטי**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

סביב כל תת-שכבה נעשה שימוש ב-**חיבורים שיוריים (residual connections)** ו-**Layer Normalization**: ${LayerNorm}(x + {Sublayer}(x))$. במקור יושם **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>; ב-LLM מודרניים נעשה שימוש תכוף ב-**Pre‑LN** לשיפור יציבות האימון ותלות פחותה ב-warm‑up ממושך<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-xiong2020-3)</sup>.

## אבולוציה וגרסאות עכשוויות

שיטות מוקדמות המבוססות על רשתות נוירונים רקורנטיות (RNN) וגרסאותיהן המתקדמות, כגון LSTM, עיבדו טקסט באופן סדרתי, token אחד בכל פעם. אף שגישה זו תאמה באופן אינטואיטיבי את מבנה השפה, היא יצרה מגבלה משמעותית: הכבידה על חישובים מקבילים וסיבכה את זיהוי התלויות בין אלמנטים שנמצאו רחוקים זה מזה בטקסט. בשנת 2017 הציגה קבוצת חוקרים מ-Google מאמר בשם «Attention Is All You Need». בו תיארו ארכיטקטורה חדשה — ה-Transformer. מודל זה ויתר לראשונה לחלוטין על שימוש ברשתות נוירונים רקורנטיות, והחליף אותן במנגנון תשומת הלב (attention). החידוש העיקרי היה שמנגנון תשומת הלב אפשר ל-Transformer להעריך את חשיבות כל מילה ברצף הקלט לצורך יצירת המילה המתאימה בפלט, תוך יכולת לעבד את כל המילים בו-זמנית. יכולת העיבוד המקבילי הזו אפשרה אימון של מודלים גדולים הרבה יותר על נפחי נתונים עצומים. כתוצאה מכך הופיעו מודלי השפה הגדולים (LLM) המודרניים.

ארכיטקטורת Transformer שימשה בסיס למגוון רחב של מודלים, המחולקים בדרך כלל לשלושה מחלקות.

### 1. מודלים של encoder בלבד (Encoder‑only)

- **דוגמה:** BERT (וגם RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-devlin2019-8)</sup>.
- **עיקרון:** פרה-אימון לפי מטלת **מידול שפה מסוכך (MLM)** עם הקשר דו-כיווני.
- **שימוש:** מטלות הבנה (סיווג, NER וכד').

### 2. מודלים של decoder בלבד (Decoder‑only)

- **דוגמה:** סדרת GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-llama2023-11)</sup>, Claude.
- **עיקרון:** **מידול שפה קאוזלי (CLM)** — ניבוי ה-token הבא; מוחלת מסיכה קאוזלית על תשומת הלב<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>.
- **שימוש:** יצירת טקסט, דיאלוגים, קוד.

### 3. מודלים encoder‑decoder

- **דוגמה:** ה-Transformer המקורי, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-raffel2019-12)</sup>.
- **עיקרון:** ה-encoder בונה ייצוג של הקלט, ה-decoder מייצר פלט ומשתמש ב-cross‑attention לתכונות ה-encoder<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-vaswani2017-1)</sup>.
- **שימוש:** מטלות seq2seq (תרגום, סיכום ועוד).

### 4. ארכיטקטורות מולטי-מודליות וחלופיות

- **Vision Transformer (ViT)** — התאמה לתמונות (פיצול לטלאים)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — מודל היררכי עם *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-liu2021-swin-14)</sup>.
- **חלופות לרצפים ארוכים:**
  - **Mamba** — מודלים סלקטיביים של מרחב מצבים (SSM) עם מורכבות לינארית<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — ארכיטקטורה דמוית RNN עם אימון מקבילי ומורכבות inference לינארית<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-peng2023-rwkv-16)</sup>.
  - **היברידיות** (למשל, **Jamba**): מחלפות בלוקי Transformer ו-Mamba; לעיתים מתוגברות ב-MoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-lieber2024-jamba-17)</sup>.

## טכניקות אימון ואופטימיזציה

היעילות של Transformer קשורה קשר הדוק לטכניקת האימון ולתשתית.

- **אסטרטגיות פרה-אימון:** CLM ו-MLM; וגם מטרות קונטרסטיביות ו-denoising (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-raffel2019-12)</sup>.
- **טכניקות fine‑tuning:**
  - **fine‑tuning מלא** של כל הפרמטרים.
  - **fine‑tuning יעיל-פרמטרים (PEFT):** **LoRA** מציגה מתאמים ממעלה נמוכה עם משקלי בסיס קפואים<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-hu2021-lora-18)</sup>.
- **יישור התנהגות:** **RLHF** — Reinforcement Learning from Human Feedback<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-ouyang2022-rlhf-19)</sup>.
- **אופטימיזציות מערכת ל-inference:** **PagedAttention/vLLM** משפרות את רוחב הפס של ה-serving באמצעות ניהול עמודים של KV cache; שימושי במיוחד ברצפים ארוכים ו-batch גדולים<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_note-kwon2023-vllm-20)</sup>.

## קישורים

- The Illustrated Transformer — הסבר ויזואלי של ארכיטקטורת Transformer

## ספרות

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## הערות

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D7%90%D7%A8%D7%9B%D7%99%D7%98%D7%A7%D7%98%D7%95%D7%A8%D7%AA_Transformer#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
