---
title: "Transformer architecture — بنية ترانسفورمر"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_بنية_ترانسفورمر"
language: "ar"
categories:
  - "Category:Arabic"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
revision_id: 8259
wiki_created_at: 2026-09-07T01:14:40Z
wiki_modified_at: 2026-09-07T01:14:40Z
downloaded_at: 2026-09-07T23:24:24Z
---

# Transformer architecture — بنية ترانسفورمر

**بنية ترانسفورمر** (Transformer Architecture) — هي بنية شبكة عصبية قدمها باحثون من Google في عام 2017 في ورقة بحثية بعنوان «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>. أحدثت هذه البنية ثورة في مجال معالجة اللغة الطبيعية (NLP) وأصبحت أساسًا لمعظم نماذج اللغة الكبيرة (LLM) الحديثة، مثل BERT وGPT وGemini. الابتكار الرئيسي في بنية ترانسفورمر هو آلية **الانتباه الذاتي (self‑attention)**، التي تسمح للنموذج بتقييم أهمية الأجزاء المختلفة من بيانات الإدخال ومعالجة التسلسلات بشكل متوازٍ، متخليةً عن التكرارية التي كانت سمة مميزة لشبكات RNN وLSTM.

## السياق التاريخي والمتطلبات الأساسية

قبل عام 2017، كانت البنى المهيمنة لمعالجة البيانات المتسلسلة، مثل النصوص، هي الشبكات العصبية المتكررة (RNN) ونسختها المحسنة، شبكات الذاكرة طويلة قصيرة المدى (LSTM).

### مشكلات RNN/LSTM التي عالجتها بنية ترانسفورمر

- **قيود المعالجة التسلسلية:** تعالج شبكات RNN وLSTM البيانات رمزًا تلو الآخر، مما يمنع التوازي داخل التسلسل ويبطئ التدريب على كميات كبيرة من البيانات.
- **مشكلة تلاشي وانفجار التدرجات:** في التسلسلات الطويلة، يمكن للتدرجات التي تنتشر للخلف عبر خطوات متعددة أن تتلاشى أو تتضخم، مما يعقد تدريب الاعتماديات طويلة المدى.
- **الاعتماديات طويلة المدى:** يمكن أن تُفقد المعلومات من بداية التسلسل بحلول نهايته.

نهج ترانسفورمر هو **التخلي الكامل عن التكرارية** لصالح آلية الانتباه. يوفر هذا النهج **طول مسار ثابت للاعتماديات** بين أي موضعين ($O(1)$)، مما يسهل نمذجة الاعتماديات بعيدة المدى، على الرغم من أن التنفيذ الأساسي للانتباه الذاتي له **تعقيد حسابي تربيعي** بالنسبة لطول التسلسل ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-tay2020-2)</sup>. مشكلة تلاشي/انفجار التدرجات لا "تختفي"، بل يتم **تخفيفها** بفضل الاتصالات المتبقية (residual connections)، وتسوية الطبقة (LayerNorm)، ونمط التدريب؛ وفي التطبيقات الحديثة، غالبًا ما يُستخدم متغير **Pre‑LayerNorm (Pre‑LN)** لكونه أكثر استقرارًا أثناء التدريب<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-xiong2020-3)</sup>.

## البنية والمكونات الرئيسية

تتكون بنية ترانسفورمر الأصلية من جزأين رئيسيين: **المُشفِّر** و**مُفكِّك التشفير**. كلا المكونين عبارة عن مكدس من الطبقات المتطابقة ($N = 6$ في الورقة الأصلية)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>.

- **بنية طبقة المُشفِّر:** (1) انتباه ذاتي متعدد الرؤوس (MHA)، (2) شبكة تلقيم أمامي موضعية (FFN)؛ كل طبقة فرعية محاطة باتصال متبقٍ وتسوية طبقة (LayerNorm)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>.
- **بنية طبقة مُفكِّك التشفير:** (1) انتباه ذاتي **مقنَّع** (قناع سببي يمنع الوصول إلى المواضع المستقبلية)، (2) **انتباه متقاطع (cross‑attention)** لمخرجات المُشفِّر، (3) شبكة FFN — أيضًا مع اتصالات متبقية وتسوية طبقة<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>.

### آلية الانتباه والانتباه الذاتي (Self‑Attention)

تحسب آلية الانتباه مجموعًا موزونًا لمتجهات القيمة (Value)، حيث يتم تحديد الأوزان بدرجة توافق المفاتيح (Key) مع الاستعلامات (Query). يستخدم ترانسفورمر آلية **انتباه الضرب النقطي المُقاس (Scaled Dot‑Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

حيث $d_{k}$ هو بُعد المفاتيح/الاستعلامات؛ القسمة على $\sqrt{d_{k}}$ تمنع تشبع دالة softmax<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>. عندما يتم توليد $Q$ و$K$ و$V$ من نفس التسلسل، تسمى الآلية **الانتباه الذاتي (self‑attention)**.

### Multi‑Head Attention (الانتباه متعدد الرؤوس)

بدلاً من استخدام مجموعة واحدة من المصفوفات $(W_{Q},W_{K},W_{V})$، يتم استخدام $h$ من "الرؤوس" المتوازية، حيث يقوم كل رأس بإسقاط $Q,K,V$ إلى فضاءات فرعية ذات أبعاد أصغر، ويحسب الانتباه بشكل مستقل، ثم يتم ربط النتائج وإسقاطها<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**خيارات لتسريع الاستدلال:**

- **MQA (Multi‑Query Attention):** تشترك جميع الرؤوس في مفتاح/قيمة واحدة ← يقلل بشكل كبير من حجم وحركة مرور ذاكرة التخزين المؤقت للمفتاح والقيمة (KV-cache) أثناء فك التشفير<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** حل وسط بين MHA وMQA — حيث تتشارك عدة مجموعات من الرؤوس في K/V؛ الجودة قريبة من MHA مع سرعة MQA<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-ainslie2023-5)</sup>.

### Positional Encoding (الترميز الموضعي)

نظرًا لأن الانتباه الذاتي لا يتأثر بترتيب الرموز، يتم إضافة **ترميزات موضعية** إلى تضمينات الإدخال.

- **الترميزات الجيبية الأصلية** (PE) من<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **الخيارات النسبية/الدورانية الحديثة:**
  - **RoPE (Rotary Position Embeddings)** تقوم بترميز التحولات النسبية عبر تدوير متجهات $Q$/$K$؛ وتُستخدم في عدد من نماذج LLM الحديثة<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-su2021-6)</sup>.
  - **ALiBi** تضيف عقوبة خطية إلى درجات الانتباه، مما يحسن من قدرة النموذج على الاستقراء إلى أطوال أكبر من تلك التي تدرب عليها<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-press2021-7)</sup>.

### شبكات FFN الموضعية، الاتصالات المتبقية، والتسوية

تحتوي كل طبقة في المُشفِّر ومُفكِّك التشفير، بالإضافة إلى الانتباه، على **شبكة FFN موضعية**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

حول كل طبقة فرعية، تُستخدم **الاتصالات المتبقية (residual connections)** و**تسوية الطبقة (Layer Normalization)**: ${LayerNorm}(x + {Sublayer}(x))$. في النسخة الأصلية، استُخدم متغير **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>؛ أما في نماذج LLM الحديثة، فغالبًا ما يُستخدم **Pre‑LN** لتحقيق استقرار أفضل في التدريب وتقليل الاعتماد على فترة إحماء (warm-up) طويلة<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-xiong2020-3)</sup>.

## التطور والبدائل الحديثة

كانت الطرق المبكرة، التي اعتمدت على الشبكات العصبية المتكررة (RNN) ومتغيراتها المتقدمة مثل LSTM، تعالج النصوص بشكل تسلسلي، رمزًا واحدًا في كل مرة. ورغم أن هذا النهج كان يتوافق بشكل حدسي مع بنية اللغة، إلا أنه خلق قيودًا كبيرة: فقد صعّب الحسابات المتوازية وعقّد اكتشاف الاعتماديات بين العناصر المتباعدة في النص. في عام 2017، قدمت مجموعة من الباحثين من Google ورقة بحثية بعنوان «Attention Is All You Need». وصفوا فيها بنية جديدة — «ترانسفورمر» (Transformer). كان هذا النموذج هو الأول الذي تخلى تمامًا عن استخدام الشبكات العصبية المتكررة، واستبدلها بآلية «الانتباه» (attention). كان الابتكار الرئيسي هو أن آلية الانتباه سمحت لنموذج ترانسفورمر بتقييم أهمية كل كلمة في تسلسل الإدخال لتوليد الكلمة المقابلة في المخرج. وفي الوقت نفسه، كان بإمكان النموذج معالجة جميع الكلمات في آن واحد. هذه القدرة على المعالجة المتوازية جعلت من الممكن تدريب نماذج أكبر بكثير على كميات هائلة من البيانات. ونتيجة لذلك، ظهرت نماذج اللغة الكبيرة الحديثة (LLM).

شكلت بنية ترانسفورمر أساسًا للعديد من النماذج التي يمكن تقسيمها بشكل عام إلى ثلاث فئات.

### 1. Encoder-only models (نماذج المُشفِّر فقط)

- **مثال:** BERT (وRoBERTa، ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-devlin2019-8)</sup>.
- **المبدأ:** التدريب المسبق على مهمة **نمذجة اللغة المقنَّعة (MLM)** بسياق ثنائي الاتجاه.
- **الاستخدام:** مهام الفهم (التصنيف، التعرف على الكيانات المسماة NER، إلخ).

### 2. Decoder-only models (نماذج مُفكِّك التشفير فقط)

- **مثال:** سلسلة GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-brown2020-10)</sup>، LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-llama2023-11)</sup>، Claude.
- **المبدأ:** **نمذجة اللغة السببية (CLM)** — التنبؤ بالرمز التالي؛ يُطبق قناع سببي على آلية الانتباه<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>.
- **الاستخدام:** توليد النصوص، الحوارات، الأكواد البرمجية.

### 3. Encoder-decoder models (نماذج المُشفِّر ومُفكِّك التشفير)

- **مثال:** بنية ترانسفورمر الأصلية، T5، BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-raffel2019-12)</sup>.
- **المبدأ:** يقوم المُشفِّر ببناء تمثيل للمدخلات، بينما يقوم مُفكِّك التشفير بتوليد المخرجات ويستخدم الانتباه المتقاطع (cross‑attention) لميزات المُشفِّر<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-vaswani2017-1)</sup>.
- **الاستخدام:** مهام seq2seq (الترجمة، التلخيص، وغيرها).

### 4. البنى متعددة الوسائط والبديلة

- **Vision Transformer (ViT)** — تكييف البنية للصور (تقسيم الصورة إلى رقع)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-dosovitskiy2020-13)</sup>؛ **Swin Transformer** — نموذج هرمي يستخدم *النوافذ المُزاحة (shifted windows)*<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-liu2021-swin-14)</sup>.
- **بدائل للتسلسلات الطويلة:**
  - **Mamba** — نماذج فضاء الحالة الانتقائية (SSM) ذات تعقيد خطي<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — بنية شبيهة بـRNN مع تدريب متوازٍ وتعقيد خطي للاستدلال<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-peng2023-rwkv-16)</sup>.
  - **الهجينة** (مثل **Jamba**): تتناوب بين كتل ترانسفورمر وMamba؛ وأحيانًا تُستكمل بـMoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-lieber2024-jamba-17)</sup>.

## تقنيات التدريب والتحسين

ترتبط كفاءة بنية ترانسفورمر ارتباطًا وثيقًا بتقنيات التدريب والبنية التحتية.

- **استراتيجيات التدريب المسبق:** CLM وMLM؛ بالإضافة إلى أهداف التباين وإزالة التشويش (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-raffel2019-12)</sup>.
- **تقنيات الضبط الدقيق (Fine‑tuning):**
  - **الضبط الدقيق الكامل** لجميع البارامترات.
  - **الضبط الدقيق بكفاءة البارامترات (PEFT):** تُدخل تقنية **LoRA** محولات منخفضة الرتبة مع تجميد الأوزان الأساسية<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-hu2021-lora-18)</sup>.
- **مواءمة السلوك:** **RLHF** — التعلم المعزز من ردود الفعل البشرية<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-ouyang2022-rlhf-19)</sup>.
- **تحسينات النظام للاستدلال:** تزيد تقنيات مثل **PagedAttention/vLLM** من إنتاجية خدمة النماذج من خلال إدارة ذاكرة التخزين المؤقت للمفتاح والقيمة (KV-cache) بشكل مُجزأ؛ وهي مفيدة بشكل خاص مع التسلسلات الطويلة والدفعات الكبيرة<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_note-kwon2023-vllm-20)</sup>.

## روابط خارجية

- <a href="https://jalammar.github.io/illustrated-transformer/" class="external text" rel="nofollow">The Illustrated Transformer — شرح مرئي لبنية ترانسفورمر</a>

## المراجع

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. <a href="https://arxiv.org/abs/1706.03762" class="external text" rel="nofollow">arXiv:1706.03762</a>.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. <a href="https://arxiv.org/abs/1810.04805" class="external text" rel="nofollow">arXiv:1810.04805</a>.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. <a href="https://arxiv.org/abs/2005.14165" class="external text" rel="nofollow">arXiv:2005.14165</a>.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. <a href="https://arxiv.org/abs/1910.10683" class="external text" rel="nofollow">arXiv:1910.10683</a>.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. <a href="https://arxiv.org/abs/2010.11929" class="external text" rel="nofollow">arXiv:2010.11929</a>.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. <a href="https://arxiv.org/abs/2103.14030" class="external text" rel="nofollow">arXiv:2103.14030</a>.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. <a href="https://arxiv.org/abs/2009.06732" class="external text" rel="nofollow">arXiv:2009.06732</a>.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. <a href="https://arxiv.org/abs/2002.04745" class="external text" rel="nofollow">arXiv:2002.04745</a>.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. <a href="https://arxiv.org/abs/2104.09864" class="external text" rel="nofollow">arXiv:2104.09864</a>.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. <a href="https://arxiv.org/abs/2108.12409" class="external text" rel="nofollow">arXiv:2108.12409</a>.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). <a href="https://arxiv.org/abs/1911.02150" class="external text" rel="nofollow">arXiv:1911.02150</a>.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. <a href="https://arxiv.org/abs/2305.13245" class="external text" rel="nofollow">arXiv:2305.13245</a>.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). <a href="https://arxiv.org/abs/2309.06180" class="external text" rel="nofollow">arXiv:2309.06180</a>.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. <a href="https://arxiv.org/abs/2302.13971" class="external text" rel="nofollow">arXiv:2302.13971</a>.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. <a href="https://arxiv.org/abs/2312.00752" class="external text" rel="nofollow">arXiv:2312.00752</a>.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. <a href="https://arxiv.org/abs/2305.13048" class="external text" rel="nofollow">arXiv:2305.13048</a>.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. <a href="https://arxiv.org/abs/2403.19887" class="external text" rel="nofollow">arXiv:2403.19887</a>.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. <a href="https://arxiv.org/abs/2106.09685" class="external text" rel="nofollow">arXiv:2106.09685</a>.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. <a href="https://openreview.net/forum?id=TG8KACxEON" class="external text" rel="nofollow">OpenReview</a>.

## ملاحظات

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%D8%A8%D9%86%D9%8A%D8%A9_%D8%AA%D8%B1%D8%A7%D9%86%D8%B3%D9%81%D9%88%D8%B1%D9%85%D8%B1#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
