---
title: "Transformer architecture (VI)"
source: "https://systems-analysis.info/int/Transformer_architecture_(VI)"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_(VI)"
language: "vi"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Vietnamese"
revision_id: 8253
wiki_created_at: 2026-09-07T01:14:35Z
wiki_modified_at: 2026-09-07T01:14:35Z
downloaded_at: 2026-09-07T23:24:21Z
---

# Transformer architecture (VI)

**Kiến trúc Transformer** — là kiến trúc mạng Neural Network được giới thiệu năm 2017 bởi các nhà nghiên cứu của Google trong bài báo «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>. Kiến trúc này đã tạo ra cuộc cách mạng trong lĩnh vực xử lý ngôn ngữ tự nhiên (NLP) và trở thành nền tảng cho hầu hết các mô hình ngôn ngữ lớn (LLM) hiện đại như BERT, GPT và Gemini. Đổi mới then chốt của Transformer là cơ chế **tự chú ý (self‑attention)**, cho phép mô hình đánh trọng số tầm quan trọng của các phần khác nhau trong dữ liệu đầu vào và xử lý các chuỗi song song, từ bỏ tính hồi quy vốn có của RNN và LSTM.

## Bối cảnh lịch sử và tiền đề

Trước năm 2017, các kiến trúc chiếm ưu thế để xử lý dữ liệu tuần tự như văn bản là mạng Neural Network hồi quy (RNN) và biến thể cải tiến của chúng — mạng bộ nhớ ngắn hạn dài (LSTM).

### Các vấn đề của RNN/LSTM mà Transformer giải quyết

- **Hạn chế của xử lý tuần tự:** RNN và LSTM xử lý dữ liệu theo từng token một, điều này loại trừ khả năng song song hóa trong chuỗi và làm chậm quá trình huấn luyện trên khối lượng dữ liệu lớn.
- **Vấn đề gradient biến mất và bùng nổ:** Trong các chuỗi dài, các gradient lan truyền ngược qua nhiều bước có thể hoặc là tiêu giảm hoặc là tăng vọt, khiến việc học các phụ thuộc dài hạn trở nên khó khăn.
- **Phụ thuộc dài hạn:** Thông tin từ đầu chuỗi có thể bị mất đến cuối chuỗi.

Cách tiếp cận của Transformer là **từ bỏ hoàn toàn tính hồi quy** để ủng hộ cơ chế chú ý. Nó đảm bảo **độ dài đường dẫn phụ thuộc không đổi** giữa bất kỳ vị trí nào ($O(1)$), giúp dễ dàng mô hình hóa các phụ thuộc tầm xa, trong khi triển khai cơ bản của self‑attention có **độ phức tạp tính toán bậc hai** theo độ dài chuỗi ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-tay2020-2)</sup>. Vấn đề gradient biến mất/bùng nổ không «biến mất» mà được **giảm nhẹ** nhờ các kết nối phần dư, LayerNorm và chế độ huấn luyện; trong các triển khai hiện đại thường sử dụng biến thể **Pre‑LayerNorm (Pre‑LN)** như một phương án ổn định hơn khi huấn luyện<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-xiong2020-3)</sup>.

## Kiến trúc và các thành phần chính

Kiến trúc Transformer gốc bao gồm hai phần chính: **encoder** và **decoder**. Cả hai thành phần đều là các ngăn xếp các lớp giống nhau ($N = 6$ trong bài báo gốc)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>.

- **Cấu trúc lớp encoder:** (1) multi-head self-attention (MHA), (2) FFN theo vị trí từng phần tử; mỗi lớp con được bao quanh bởi kết nối phần dư và LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>.
- **Cấu trúc lớp decoder:** (1) self-attention có **mặt nạ** (mặt nạ nhân quả ngăn truy cập vào các vị trí tương lai), (2) **cross‑attention** đến đầu ra của encoder, (3) FFN — cũng với các kết nối phần dư và LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>.

### Cơ chế chú ý và Self‑Attention

Cơ chế chú ý tính tổng có trọng số của các vector giá trị (Value), trong đó các trọng số được xác định bởi mức độ tương thích của các khóa (Key) với các truy vấn (Query). Transformer sử dụng **chú ý tích vô hướng có tỷ lệ (Scaled Dot‑Product Attention)**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

Trong đó $d_{k}$ — chiều của các khóa/truy vấn; việc chia cho $\sqrt{d_{k}}$ ngăn chặn sự bão hòa của softmax<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>. Khi $Q$, $K$ và $V$ được sinh ra từ cùng một chuỗi, cơ chế được gọi là **tự chú ý (self‑attention)**.

### Multi‑Head Attention (chú ý đa đầu)

Thay vì một tập ma trận $(W_{Q},W_{K},W_{V})$ duy nhất, ta sử dụng $h$ «đầu» song song, mỗi đầu chiếu $Q,K,V$ vào các không gian con có chiều nhỏ hơn, tính toán chú ý độc lập, sau đó các kết quả được ghép nối và chiếu<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**Các biến thể để tăng tốc inference:**

- **MQA (Multi‑Query Attention):** tất cả các đầu chia sẻ một khóa/giá trị → giảm đáng kể kích thước và lưu lượng KV‑cache khi giải mã<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-shazeer2019-4)</sup>.
- **GQA (Grouped‑Query Attention):** sự thỏa hiệp giữa MHA và MQA — một số nhóm đầu chia sẻ K/V; chất lượng gần với MHA với tốc độ của MQA<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-ainslie2023-5)</sup>.

### Mã hóa vị trí (Positional Encoding)

Vì self‑attention bất biến với thứ tự token, các **mã hóa vị trí** được cộng vào các embedding đầu vào.

- **Mã hóa sin/cos gốc** (PE) từ<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **Các biến thể tương đối/xoay hiện đại:**
  - **RoPE (Rotary Position Embeddings)** mã hóa các độ dịch tương đối thông qua việc xoay các vector $Q$/$K$; được áp dụng trong một số LLM hiện đại<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-su2021-6)</sup>.
  - **ALiBi** đưa vào hình phạt tuyến tính trong các điểm chú ý, giúp cải thiện khả năng ngoại suy trên các độ dài lớn hơn độ dài huấn luyện<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-press2021-7)</sup>.

### FFN theo từng phần tử, kết nối phần dư và chuẩn hóa

Mỗi lớp encoder và decoder, ngoài chú ý, còn chứa **FFN theo vị trí từng phần tử**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

Xung quanh mỗi lớp con sử dụng **kết nối phần dư (residual connections)** và **Layer Normalization**: ${LayerNorm}(x + {Sublayer}(x))$. Trong bản gốc, biến thể **Post‑LN** được áp dụng<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>; trong các LLM hiện đại thường sử dụng **Pre‑LN** để ổn định huấn luyện tốt hơn và giảm sự phụ thuộc vào giai đoạn warm‑up dài<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-xiong2020-3)</sup>.

## Sự phát triển và các biến thể hiện đại

Các phương pháp ban đầu dựa trên mạng Neural Network hồi quy (RNN) và các biến thể tiên tiến của chúng như LSTM xử lý văn bản tuần tự, từng token một. Mặc dù cách tiếp cận này trực quan phù hợp với cấu trúc ngôn ngữ, nhưng nó tạo ra hạn chế đáng kể: gây khó khăn cho tính toán song song và làm phức tạp việc phát hiện các phụ thuộc giữa các phần tử nằm xa nhau trong văn bản. Năm 2017, một nhóm nhà nghiên cứu từ Google đã trình bày bài báo có tên «Attention Is All You Need». Trong đó, họ mô tả một kiến trúc mới — «Transformer». Mô hình này lần đầu tiên hoàn toàn từ bỏ việc sử dụng mạng Neural Network hồi quy, thay thế chúng bằng cơ chế «chú ý» (attention). Sự đổi mới chính là cơ chế chú ý cho phép Transformer đánh giá tầm quan trọng của mỗi từ trong chuỗi đầu vào để tạo ra từ tương ứng trong đầu ra. Đồng thời, mô hình có thể xử lý tất cả các từ cùng một lúc. Khả năng xử lý song song này đã cho phép huấn luyện các mô hình lớn hơn nhiều trên khối lượng dữ liệu khổng lồ. Kết quả là các mô hình ngôn ngữ lớn (LLM) hiện đại ra đời.

Kiến trúc Transformer đã trở thành nền tảng cho nhiều mô hình, được phân loại theo ba lớp.

### 1. Mô hình chỉ encoder (Encoder‑only)

- **Ví dụ:** BERT (và RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-devlin2019-8)</sup>.
- **Nguyên lý:** tiền huấn luyện theo nhiệm vụ **mô hình hóa ngôn ngữ có mặt nạ (MLM)** với ngữ cảnh hai chiều.
- **Ứng dụng:** các nhiệm vụ hiểu ngôn ngữ (phân loại, NER, v.v.).

### 2. Mô hình chỉ decoder (Decoder‑only)

- **Ví dụ:** dòng GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-llama2023-11)</sup>, Claude.
- **Nguyên lý:** **mô hình hóa ngôn ngữ nhân quả (CLM)** — dự đoán token tiếp theo; chú ý được áp mặt nạ nhân quả<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>.
- **Ứng dụng:** tạo văn bản, hội thoại, mã lập trình.

### 3. Mô hình encoder‑decoder (Encoder‑decoder)

- **Ví dụ:** Transformer gốc, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-raffel2019-12)</sup>.
- **Nguyên lý:** encoder xây dựng biểu diễn đầu vào, decoder tạo ra đầu ra và sử dụng cross‑attention đến các đặc trưng của encoder<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-vaswani2017-1)</sup>.
- **Ứng dụng:** các nhiệm vụ seq2seq (dịch máy, tóm tắt văn bản, v.v.).

### 4. Kiến trúc đa phương thức và thay thế

- **Vision Transformer (ViT)** — thích nghi với hình ảnh (phân chia thành các patch)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — mô hình phân cấp với *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-liu2021-swin-14)</sup>.
- **Các phương án thay thế cho chuỗi dài:**
  - **Mamba** — mô hình không gian trạng thái chọn lọc (SSM) với độ phức tạp tuyến tính<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-gu2023-mamba-15)</sup>.
  - **RWKV** — kiến trúc giống RNN với huấn luyện song song và độ phức tạp inference tuyến tính<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-peng2023-rwkv-16)</sup>.
  - **Kiến trúc lai** (ví dụ: **Jamba**): xen kẽ các khối Transformer và Mamba; đôi khi được bổ sung MoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-lieber2024-jamba-17)</sup>.

## Kỹ thuật huấn luyện và tối ưu hóa

Hiệu quả của Transformer gắn chặt với kỹ thuật huấn luyện và cơ sở hạ tầng.

- **Chiến lược tiền huấn luyện:** CLM và MLM; cũng có các mục tiêu đối lập và khử nhiễu (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-raffel2019-12)</sup>.
- **Kỹ thuật fine-tuning:**
  - **Fine-tuning toàn bộ** tất cả các tham số.
  - **Fine-tuning hiệu quả tham số (PEFT):** **LoRA** đưa vào các bộ điều hợp hạng thấp với các trọng số cơ sở bị đóng băng<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-hu2021-lora-18)</sup>.
- **Căn chỉnh hành vi:** **RLHF** — Reinforcement Learning từ phản hồi của con người<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-ouyang2022-rlhf-19)</sup>.
- **Tối ưu hóa hệ thống inference:** **PagedAttention/vLLM** tăng thông lượng phục vụ nhờ quản lý KV‑cache theo trang; đặc biệt hữu ích với các chuỗi dài và batch lớn<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_note-kwon2023-vllm-20)</sup>.

## Liên kết

- The Illustrated Transformer — giải thích trực quan kiến trúc Transformer

## Tài liệu tham khảo

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## Ghi chú

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_(VI)#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
