---
title: "Transformer architecture — สถาปัตยกรรม Transformer"
source: "https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer"
wiki: "systems-analysis.info/int"
article: "Transformer_architecture_—_สถาปัตยกรรม_Transformer"
language: "th"
categories:
  - "Category:Core LLM concepts"
  - "Category:Large language models"
  - "Category:LLM core concepts"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 8264
wiki_created_at: 2026-09-07T01:14:44Z
wiki_modified_at: 2026-09-07T01:14:44Z
downloaded_at: 2026-09-07T23:24:26Z
---

# Transformer architecture — สถาปัตยกรรม Transformer

**สถาปัตยกรรม Transformer** — คือสถาปัตยกรรม Neural Network ที่เสนอขึ้นในปี 2017 โดยนักวิจัยของ Google ในบทความ «Attention Is All You Need»<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup> สถาปัตยกรรมนี้ได้ปฏิวัติวงการประมวลผลภาษาธรรมชาติ (NLP) และกลายเป็นรากฐานของ Large Language Model (LLM) สมัยใหม่ส่วนใหญ่ เช่น BERT, GPT และ Gemini นวัตกรรมสำคัญของ Transformer คือกลไก **self‑attention** ซึ่งช่วยให้โมเดลสามารถถ่วงน้ำหนักความสำคัญของส่วนต่าง ๆ ของข้อมูลนำเข้าและประมวลผลลำดับข้อมูลแบบขนานได้ โดยละทิ้งความเป็นแบบเวียนซ้ำที่มีอยู่ใน RNN และ LSTM

## บริบททางประวัติศาสตร์และพื้นหลัง

ก่อนปี 2017 สถาปัตยกรรมหลักที่ใช้ประมวลผลข้อมูลลำดับ เช่น ข้อความ ได้แก่ Recurrent Neural Network (RNN) และตัวแปรที่พัฒนาแล้ว คือ Long Short-Term Memory (LSTM)

### ปัญหาของ RNN/LSTM ที่ Transformer แก้ไข

- **ข้อจำกัดของการประมวลผลแบบลำดับ:** RNN และ LSTM ประมวลผลข้อมูลทีละ token ซึ่งทำให้ไม่สามารถประมวลผลแบบขนานภายในลำดับเดียวกันได้ และทำให้การฝึกบนข้อมูลปริมาณมากช้าลง
- **ปัญหา gradient สูญหายและระเบิด:** ในลำดับที่ยาว gradient ที่แพร่กระจายย้อนกลับผ่านหลายขั้นตอนอาจลดลงจนเป็นศูนย์หรือเพิ่มขึ้นอย่างไม่มีขอบเขต ทำให้การเรียนรู้ความสัมพันธ์ระยะยาวเป็นเรื่องยาก
- **ความสัมพันธ์ระยะยาว:** ข้อมูลจากต้นลำดับอาจสูญหายไปก่อนถึงปลายลำดับ

แนวทางของ Transformer คือ **การละทิ้งความเป็นแบบเวียนซ้ำโดยสิ้นเชิง** เพื่อหันมาใช้กลไก attention แทน วิธีนี้ให้ **ความยาวเส้นทางของความสัมพันธ์แบบคงที่** ระหว่างตำแหน่งใด ๆ ($O(1)$) ซึ่งช่วยให้การสร้างแบบจำลองความสัมพันธ์ระยะยาวง่ายขึ้น ในขณะที่การ implement self‑attention พื้นฐานมี **ความซับซ้อนในการคำนวณแบบกำลังสอง** ตามความยาวลำดับ ($O(n^{2})$)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)[\[2\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-tay2020-2)</sup> ปัญหา gradient สูญหาย/ระเบิดไม่ได้ «หายไป» แต่ **บรรเทาลง** ด้วย residual connection, LayerNorm และรูปแบบการฝึก โดยในการ implement สมัยใหม่มักใช้ตัวแปร **Pre‑LayerNorm (Pre‑LN)** เนื่องจากมีความเสถียรในการฝึกมากกว่า<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-xiong2020-3)</sup>

## สถาปัตยกรรมและองค์ประกอบสำคัญ

สถาปัตยกรรม Transformer ดั้งเดิมประกอบด้วยสองส่วนหลัก ได้แก่ **encoder** และ **decoder** ทั้งสองส่วนเป็น stack ของเลเยอร์ที่เหมือนกัน ($N = 6$ ในบทความต้นฉบับ)<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup>

- **โครงสร้างเลเยอร์ encoder:** (1) Multi-Head Attention (MHA) แบบ self‑attention, (2) FFN แบบ position-wise; แต่ละเลเยอร์ย่อยล้อมรอบด้วย residual connection และ LayerNorm<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup>
- **โครงสร้างเลเยอร์ decoder:** (1) self‑attention แบบ **masked** (causal mask ป้องกันการเข้าถึงตำแหน่งที่อยู่ข้างหน้า), (2) **cross‑attention** ต่อผลลัพธ์ของ encoder, (3) FFN — พร้อม residual และ LayerNorm เช่นกัน<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup>

### กลไก attention และ Self‑Attention

กลไก attention คำนวณผลรวมถ่วงน้ำหนักของเวกเตอร์ Value โดยน้ำหนักถูกกำหนดจากระดับความเข้ากันได้ของ Key กับ Query ใน Transformer ใช้ **Scaled Dot‑Product Attention**:

${Attention}(Q,K,V) = {softmax}\!\left( \frac{QK^{\top}}{\sqrt{d_{k}}} \right)V$

โดยที่ $d_{k}$ คือมิติของ Key/Query การหารด้วย $\sqrt{d_{k}}$ ป้องกันการอิ่มตัวของ softmax<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup> เมื่อ $Q$, $K$ และ $V$ มาจากลำดับเดียวกัน กลไกนี้เรียกว่า **self‑attention**

### Multi‑Head Attention (ความสนใจแบบหลายหัว)

แทนที่จะใช้ชุดเมทริกซ์ $(W_{Q},W_{K},W_{V})$ ชุดเดียว จะใช้ $h$ «หัว» แบบขนาน แต่ละหัวจะฉาย $Q,K,V$ ไปยังปริภูมิย่อยที่มีมิติน้อยกว่า คำนวณ attention แยกกัน จากนั้นนำผลลัพธ์มาต่อกัน (concatenate) และฉายออกมา<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup>:

${MultiHead}(Q,K,V) = {Concat}(\text{head}_{1},\ldots,\text{head}_{h})W^{O},\quad\text{где~}\text{head}_{i} = {Attention}(QW_{i}^{Q},KW_{i}^{K},VW_{i}^{V}).$

**ตัวแปรสำหรับเร่งความเร็วการ inference:**

- **MQA (Multi‑Query Attention):** ทุกหัวใช้ key/value ชุดเดียวร่วมกัน → ลดปริมาณและ traffic ของ KV‑cache ระหว่างการ decode อย่างมีนัยสำคัญ<sup>[\[4\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-shazeer2019-4)</sup>
- **GQA (Grouped‑Query Attention):** เป็นการประนีประนอมระหว่าง MHA และ MQA โดยกลุ่มหัวหลายกลุ่มใช้ K/V ร่วมกัน คุณภาพใกล้เคียง MHA แต่มีความเร็วเทียบเท่า MQA<sup>[\[5\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-ainslie2023-5)</sup>

### Positional Encoding (การเข้ารหัสตำแหน่ง)

เนื่องจาก self‑attention ไม่รับรู้ลำดับของ token จึงมีการเพิ่ม **positional encoding** เข้าไปใน embedding ของข้อมูลนำเข้า

- **การเข้ารหัสแบบ sinusoidal ดั้งเดิม** (PE) จาก<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup>:

$\text{PE}(\text{pos},2i) = \sin\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right),\quad\text{PE}(\text{pos},2i + 1) = \cos\!\left( \text{pos}/10000^{2i/d_{\text{model}}} \right).$

- **ตัวแปรแบบสัมพัทธ์/แบบหมุนสมัยใหม่:**
  - **RoPE (Rotary Position Embeddings)** เข้ารหัสการเลื่อนสัมพัทธ์ผ่านการหมุนเวกเตอร์ $Q$/$K$ ถูกนำมาใช้ใน LLM สมัยใหม่หลายตัว<sup>[\[6\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-su2021-6)</sup>
  - **ALiBi** เพิ่มโทษแบบเชิงเส้นใน attention score ซึ่งช่วยให้ extrapolate ไปยังความยาวที่เกินกว่าที่ฝึกได้ดีขึ้น<sup>[\[7\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-press2021-7)</sup>

### FFN แบบ position-wise, residual และการ normalize

แต่ละเลเยอร์ของ encoder และ decoder นอกจาก attention แล้ว ยังมี **FFN แบบ position-wise**:

${FFN}(x) = \max(0,xW_{1} + b_{1})W_{2} + b_{2}.$

รอบ ๆ แต่ละเลเยอร์ย่อยจะใช้ **residual connection** และ **Layer Normalization**: ${LayerNorm}(x + {Sublayer}(x))$ ในเวอร์ชันดั้งเดิมใช้รูปแบบ **Post‑LN**<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup> ใน LLM สมัยใหม่มักใช้ **Pre‑LN** เพื่อความเสถียรในการฝึกที่ดีกว่าและลดการพึ่งพา warm‑up ยาว<sup>[\[3\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-xiong2020-3)</sup>

## วิวัฒนาการและตัวแปรสมัยใหม่

วิธีการในยุคแรกที่อิงกับ RNN และตัวแปรขั้นสูงอย่าง LSTM ประมวลผลข้อความแบบลำดับทีละ token แม้แนวทางนี้จะสอดคล้องกับโครงสร้างของภาษาได้โดยธรรมชาติ แต่ก็สร้างข้อจำกัดสำคัญ คือ ทำให้การประมวลผลแบบขนานทำได้ยาก และทำให้การค้นหาความสัมพันธ์ระหว่างองค์ประกอบที่อยู่ห่างกันในข้อความเป็นเรื่องยาก ในปี 2017 กลุ่มนักวิจัยจาก Google นำเสนอบทความชื่อ «Attention Is All You Need» โดยอธิบายสถาปัตยกรรมใหม่ที่ชื่อว่า Transformer โมเดลนี้ละทิ้งการใช้ Recurrent Neural Network อย่างสมบูรณ์เป็นครั้งแรก โดยแทนที่ด้วยกลไก attention นวัตกรรมหลักอยู่ที่กลไก attention ช่วยให้ Transformer ประเมินความสำคัญของแต่ละคำในลำดับนำเข้าสำหรับการสร้างคำที่สอดคล้องในผลลัพธ์ได้ ในขณะเดียวกันโมเดลสามารถประมวลผลคำทั้งหมดพร้อมกันได้ ความสามารถในการประมวลผลแบบขนานนี้ทำให้สามารถฝึกโมเดลขนาดใหญ่กว่าบนข้อมูลปริมาณมหาศาลได้ และนำมาสู่การกำเนิด Large Language Model (LLM) สมัยใหม่

สถาปัตยกรรม Transformer เป็นรากฐานของโมเดลจำนวนมาก ซึ่งสามารถแบ่งออกเป็นสามประเภทหลัก

### 1. โมเดลแบบ Encoder เท่านั้น (Encoder‑only)

- **ตัวอย่าง:** BERT (และ RoBERTa, ALBERT)<sup>[\[8\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-devlin2019-8)</sup>
- **หลักการ:** ฝึกล่วงหน้าด้วยงาน **Masked Language Modeling (MLM)** พร้อม context แบบสองทิศทาง
- **การประยุกต์ใช้:** งานทำความเข้าใจ (การจำแนก, NER เป็นต้น)

### 2. โมเดลแบบ Decoder เท่านั้น (Decoder‑only)

- **ตัวอย่าง:** ซีรีส์ GPT (GPT‑1/2/3)<sup>[\[9\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-radford2018-9)[\[10\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-brown2020-10)</sup>, LLaMA<sup>[\[11\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-llama2023-11)</sup>, Claude
- **หลักการ:** **Causal Language Modeling (CLM)** — การทำนาย token ถัดไป โดย attention ถูกกำหนดด้วย causal mask<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup>
- **การประยุกต์ใช้:** การสร้างข้อความ บทสนทนา โค้ด

### 3. โมเดลแบบ Encoder‑Decoder

- **ตัวอย่าง:** Transformer ต้นฉบับ, T5, BART<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-raffel2019-12)</sup>
- **หลักการ:** encoder สร้างการแทนค่าของข้อมูลนำเข้า decoder สร้างผลลัพธ์และใช้ cross‑attention กับ feature ของ encoder<sup>[\[1\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-vaswani2017-1)</sup>
- **การประยุกต์ใช้:** งาน seq2seq (การแปลภาษา การสรุปความ เป็นต้น)

### 4. สถาปัตยกรรมแบบมัลติโมดัลและทางเลือกอื่น

- **Vision Transformer (ViT)** — การปรับใช้กับภาพ (การแบ่งเป็น patch)<sup>[\[13\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-dosovitskiy2020-13)</sup>; **Swin Transformer** — โมเดลแบบลำดับชั้นที่ใช้ *shifted windows*<sup>[\[14\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-liu2021-swin-14)</sup>
- **ทางเลือกสำหรับลำดับยาว:**
  - **Mamba** — Selective State Space Model (SSM) ที่มีความซับซ้อนเชิงเส้น<sup>[\[15\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-gu2023-mamba-15)</sup>
  - **RWKV** — สถาปัตยกรรมคล้าย RNN ที่ฝึกแบบขนานได้และมีความซับซ้อนการ inference เชิงเส้น<sup>[\[16\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-peng2023-rwkv-16)</sup>
  - **Hybrid** (เช่น **Jamba**): สลับบล็อก Transformer และ Mamba บางครั้งเสริมด้วย MoE<sup>[\[17\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-lieber2024-jamba-17)</sup>

## เทคนิคการฝึกและการปรับแต่ง

ประสิทธิภาพของ Transformer มีความเชื่อมโยงอย่างใกล้ชิดกับเทคนิคการฝึกและโครงสร้างพื้นฐาน

- **กลยุทธ์การฝึกล่วงหน้า:** CLM และ MLM รวมถึง objective แบบ contrastive และ denoising (ELECTRA, T5)<sup>[\[12\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-raffel2019-12)</sup>
- **เทคนิคการ fine-tuning:**
  - **การ fine-tuning เต็มรูปแบบ** ของพารามิเตอร์ทั้งหมด
  - **Parameter-Efficient Fine-Tuning (PEFT):** **LoRA** เพิ่ม adapter แบบ low-rank โดยน้ำหนักพื้นฐานถูก freeze ไว้<sup>[\[18\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-hu2021-lora-18)</sup>
- **การปรับพฤติกรรม:** **RLHF** — Reinforcement Learning from Human Feedback<sup>[\[19\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-ouyang2022-rlhf-19)</sup>
- **การปรับแต่งระบบสำหรับการ inference:** **PagedAttention/vLLM** เพิ่ม throughput ของการให้บริการด้วยการจัดการ KV‑cache แบบ paging มีประโยชน์อย่างยิ่งสำหรับลำดับยาวและ batch ขนาดใหญ่<sup>[\[20\]](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_note-kwon2023-vllm-20)</sup>

## ลิงก์

- The Illustrated Transformer — คำอธิบายสถาปัตยกรรม Transformer แบบภาพ

## บรรณานุกรม

- Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.
- Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.
- Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI Technical Report.
- Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.
- Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. arXiv:1910.10683.
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. arXiv:2010.11929.
- Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. arXiv:2103.14030.
- Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.
- Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.
- Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.
- Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need* (MQA). arXiv:1911.02150.
- Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.
- Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention* (vLLM). arXiv:2309.06180.
- Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.
- Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.
- Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.
- Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.
- Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.

## หมายเหตุ

1.  <span id="cite_note-vaswani2017-1">↑ <sup>[1.00](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-vaswani2017_1-11)</sup> Vaswani, A., Shazeer, N., Parmar, N., et al. (2017). *Attention Is All You Need*. NeurIPS. arXiv:1706.03762.</span>
2.  <span id="cite_note-tay2020-2">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-tay2020_2-0) Tay, Y., Dehghani, M., Bahri, D., Metzler, D. (2020). *Efficient Transformers: A Survey*. arXiv:2009.06732.</span>
3.  <span id="cite_note-xiong2020-3">↑ <sup>[3.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-xiong2020_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-xiong2020_3-1)</sup> Xiong, R., Yang, Y., He, D., et al. (2020). *On Layer Normalization in the Transformer Architecture*. ICML. arXiv:2002.04745.</span>
4.  <span id="cite_note-shazeer2019-4">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-shazeer2019_4-0) Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.</span>
5.  <span id="cite_note-ainslie2023-5">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-ainslie2023_5-0) Ainslie, J., Lee‑Thorp, J., de Jong, M., et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. EMNLP. arXiv:2305.13245.</span>
6.  <span id="cite_note-su2021-6">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-su2021_6-0) Su, J., Lu, Y., Pan, S., et al. (2021). *RoFormer: Rotary Position Embedding*. arXiv:2104.09864.</span>
7.  <span id="cite_note-press2021-7">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-press2021_7-0) Press, O., Smith, N. A., Lewis, M. (2021). *Train Short, Test Long: Attention with Linear Biases (ALiBi)*. arXiv:2108.12409.</span>
8.  <span id="cite_note-devlin2019-8">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-devlin2019_8-0) Devlin, J., Chang, M.‑W., Lee, K., Toutanova, K. (2019). *BERT: Pre‑training of Deep Bidirectional Transformers for Language Understanding*. arXiv:1810.04805.</span>
9.  <span id="cite_note-radford2018-9">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-radford2018_9-0) Radford, A., Narasimhan, K., Salimans, T., Sutskever, I. (2018). *Improving Language Understanding by Generative Pre‑Training*. OpenAI.</span>
10. <span id="cite_note-brown2020-10">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-brown2020_10-0) Brown, T. B., Mann, B., Ryder, N., et al. (2020). *Language Models Are Few‑Shot Learners*. NeurIPS. arXiv:2005.14165.</span>
11. <span id="cite_note-llama2023-11">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-llama2023_11-0) Touvron, H., Lavril, T., Izacard, G., et al. (2023). *LLaMA: Open and Efficient Foundation Language Models*. arXiv:2302.13971.</span>
12. <span id="cite_note-raffel2019-12">↑ <sup>[12.0](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-raffel2019_12-0)</sup> <sup>[12.1](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-raffel2019_12-1)</sup> Raffel, C., Shazeer, N., Roberts, A., et al. (2019). *Exploring the Limits of Transfer Learning with a Unified Text‑to‑Text Transformer*. JMLR. arXiv:1910.10683.</span>
13. <span id="cite_note-dosovitskiy2020-13">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-dosovitskiy2020_13-0) Dosovitskiy, A., Beyer, L., Kolesnikov, A., et al. (2020). *An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale*. ICLR. arXiv:2010.11929.</span>
14. <span id="cite_note-liu2021-swin-14">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-liu2021-swin_14-0) Liu, Z., Lin, Y., Cao, Y., et al. (2021). *Swin Transformer: Hierarchical Vision Transformer using Shifted Windows*. ICCV. arXiv:2103.14030.</span>
15. <span id="cite_note-gu2023-mamba-15">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-gu2023-mamba_15-0) Gu, A., Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.</span>
16. <span id="cite_note-peng2023-rwkv-16">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-peng2023-rwkv_16-0) Peng, B., et al. (2023). *RWKV: Reinventing RNNs for the Transformer Era*. arXiv:2305.13048.</span>
17. <span id="cite_note-lieber2024-jamba-17">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-lieber2024-jamba_17-0) Lieber, O., Lenz, B., Bata, H., et al. (2024). *Jamba: A Hybrid Transformer‑Mamba Language Model*. arXiv:2403.19887.</span>
18. <span id="cite_note-hu2021-lora-18">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-hu2021-lora_18-0) Hu, E. J., Shen, Y., Wallis, P., et al. (2021). *LoRA: Low‑Rank Adaptation of Large Language Models*. arXiv:2106.09685.</span>
19. <span id="cite_note-ouyang2022-rlhf-19">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-ouyang2022-rlhf_19-0) Ouyang, L., Wu, J., Jiang, X., et al. (2022). *Training language models to follow instructions with human feedback*. OpenReview.</span>
20. <span id="cite_note-kwon2023-vllm-20">[↑](https://systems-analysis.info/int/Transformer_architecture_%E2%80%94_%E0%B8%AA%E0%B8%96%E0%B8%B2%E0%B8%9B%E0%B8%B1%E0%B8%95%E0%B8%A2%E0%B8%81%E0%B8%A3%E0%B8%A3%E0%B8%A1_Transformer#cite_ref-kwon2023-vllm_20-0) Kwon, W., Li, Z., Zhuang, S., et al. (2023). *Efficient Memory Management for LLM Serving with PagedAttention*. arXiv:2309.06180.</span>
