Encoder-only models — โมเดลเฉพาะตัวเข้ารหัส
โมเดลเฉพาะตัวเข้ารหัส (อังกฤษ: Encoder-Only Models) — คือกลุ่มสถาปัตยกรรมของโมเดลภาษาขนาดใหญ่ (LLM) ที่ใช้เฉพาะส่วนเข้ารหัส (encoder) ของสถาปัตยกรรม Transformer เท่านั้น แตกต่างจากโมเดลที่ใช้ตัวถอดรหัสหรือสถาปัตยกรรม encoder-decoder แบบเต็มรูปแบบ โมเดลเหล่านี้เชี่ยวชาญด้านงานความเข้าใจภาษาธรรมชาติ (Natural Language Understanding, NLU).
โมเดลชั้นนำและผู้บุกเบิกแนวทางนี้คือ BERT (Bidirectional Encoder Representations from Transformers) ซึ่งพัฒนาโดย Google ในปี 2018
แนวคิดและสถาปัตยกรรม
แนวคิดหลักของโมเดลเฉพาะตัวเข้ารหัสคือการสร้างการแทนค่าเชิงบริบท (embedding) เชิงลึกสำหรับแต่ละ token ในลำดับอินพุต ด้วยกลไกการสนใจตัวเอง (self-attention) ใน Transformer แต่ละ token สามารถ "มองเห็น" และโต้ตอบกับ token อื่น ๆ ทั้งหมดในลำดับ ทำให้โมเดลสามารถจับบริบทที่สมบูรณ์ได้
คุณลักษณะสำคัญคือความเป็นสองทิศทาง: การแทนค่าของแต่ละ token ถูกสร้างจากทั้งบริบทด้านซ้ายและด้านขวาพร้อมกัน สิ่งนี้แตกต่างอย่างมากจากโมเดลเฉพาะตัวถอดรหัสแบบ autoregressive (เช่น GPT) ซึ่งโดยธรรมชาติแล้วเป็นแบบทิศทางเดียว
ในด้านสถาปัตยกรรม โมเดลประกอบด้วยชั้น encoder ที่เหมือนกัน ชั้น แต่ละชั้นประกอบด้วยชั้นย่อยหลักสองชั้น:
- การสนใจตัวเองแบบหลายหัว (Multi-Head Self-Attention): คำนวณการแทนค่าเชิงบริบทสำหรับแต่ละ token
- โครงข่ายประสาทแบบเชื่อมต่อเต็มรูปแบบ (Feed-Forward Network): ใช้การแปลงแบบไม่เชิงเส้นกับการแทนค่าของแต่ละ token
ที่เอาต์พุต โมเดลจะสร้างลำดับของเวกเตอร์ที่มีความยาวเท่ากับลำดับอินพุต โดยแต่ละเวกเตอร์คือการแทนค่าที่สมบูรณ์ของ token อินพุตที่สอดคล้องกัน
งานการเรียนรู้ล่วงหน้า
เพื่อสอนให้โมเดลเข้าใจภาษาในบริบทแบบสองทิศทาง จะใช้งานการเรียนรู้ล่วงหน้าแบบ self-supervised เฉพาะทาง:
Masked Language Modeling - การสร้างแบบจำลองภาษาแบบปิดบัง (MLM)
นี่คืองานหลักและสำคัญที่สุดสำหรับโมเดลเฉพาะตัวเข้ารหัส ซึ่งนำเสนอครั้งแรกใน BERT
- หลักการทำงาน: token จำนวนหนึ่งในลำดับอินพุตถูกซ่อน (ปิดบัง) แบบสุ่ม (โดยทั่วไปประมาณ 15%) งานของโมเดลคือการทำนายค่าเดิมของ token ที่ถูกปิดบังเหล่านั้น โดยใช้บริบทสองทิศทางที่ล้อมรอบ
- เป้าหมาย: งานนี้บังคับให้โมเดลเรียนรู้ความสัมพันธ์ทางความหมายและวากยสัมพันธ์เชิงลึกระหว่างคำ
Next Sentence Prediction - การทำนายประโยคถัดไป (NSP)
งานนี้ (จาก BERT ต้นฉบับเช่นกัน) ได้รับการออกแบบเพื่อสอนให้โมเดลเข้าใจความสัมพันธ์ระหว่างประโยค
- หลักการทำงาน: โมเดลได้รับคู่ประโยคและต้องระบุว่าประโยคที่สองเป็นการต่อเนื่องที่สมเหตุสมผลของประโยคแรกในข้อความต้นฉบับหรือไม่
- สถานะ: ต่อมางานวิจัย (เช่น ในโมเดล RoBERTa) แสดงให้เห็นว่า NSP มีประสิทธิภาพน้อยกว่า MLM และมักถูกแทนที่ด้วยงานอื่นหรือถูกลบออกทั้งหมด
การประยุกต์ใช้งาน
โมเดลเฉพาะตัวเข้ารหัสไม่ได้ออกแบบมาเพื่อการสร้างข้อความแบบอิสระ เนื่องจากไม่มีตัวถอดรหัสแบบ autoregressive ความแข็งแกร่งของโมเดลอยู่ที่การวิเคราะห์และทำความเข้าใจข้อความ การแทนค่าเชิงเวกเตอร์เอาต์พุตของโมเดลถูกนำไปใช้แก้ปัญหางาน NLU หลากหลายประเภท:
- การจำแนกข้อความ: สำหรับงานเช่นการวิเคราะห์ความรู้สึกหรือการระบุหัวข้อ จะใช้การแทนค่าของ token พิเศษ `[CLS]` ซึ่งเพิ่มไว้ที่ต้นของแต่ละลำดับ เวกเตอร์สุดท้ายของมันรวบรวมข้อมูลของลำดับทั้งหมด
- การจำแนก token: สำหรับงานเช่นการรู้จำหน่วยที่มีชื่อ (NER) หรือการติดป้ายกำกับชนิดของคำ (POS-tagging) จะใช้การแทนค่าเชิงเวกเตอร์ของแต่ละ token แยกกัน
- การตอบคำถาม (Question Answering): ในงานที่คำตอบเป็นส่วนหนึ่งของข้อความที่กำหนด (extractive QA) โมเดลได้รับการฝึกให้ทำนาย token เริ่มต้นและสิ้นสุดของคำตอบ
- การรับ embedding: โมเดล encoder มักถูกใช้เป็นตัวเข้ารหัสข้อความอเนกประสงค์เพื่อรับ embedding คุณภาพสูงของประโยคหรือเอกสาร ซึ่งสามารถนำไปใช้ในระบบค้นหาหรืองานความคล้ายคลึงเชิงความหมายได้
โมเดลหลักและวิวัฒนาการ
- BERT (2018): ผู้บุกเบิกสถาปัตยกรรม สร้างสถิติใหม่ใน NLP benchmark หลายรายการ
- RoBERTa (2019): "BERT ที่ปรับแต่งอย่างมีประสิทธิภาพ" แสดงให้เห็นว่าประสิทธิภาพของ BERT สามารถปรับปรุงได้อย่างมากด้วยการฝึกที่นานขึ้นบนข้อมูลจำนวนมากขึ้นและการยกเลิกงาน NSP
- ALBERT (2019): "A Lite BERT" โมเดลที่มีจำนวนพารามิเตอร์น้อยกว่าอย่างมีนัยสำคัญ ด้วยเทคนิคการแยกตัวประกอบ embedding และการแชร์พารามิเตอร์ระหว่างชั้น
- DistilBERT (2019): เวอร์ชันที่ย่อขนาดของ BERT สร้างด้วยการกลั่นกรองความรู้ (knowledge distillation) ซึ่งเร็วและเบากว่า แต่ยังคงรักษาประสิทธิภาพส่วนใหญ่ของต้นฉบับไว้
- ELECTRA (2020): นำเสนองานการเรียนรู้ล่วงหน้าที่มีประสิทธิภาพมากขึ้น — replaced token detection ซึ่งโมเดลเรียนรู้การแยกแยะ token ต้นฉบับจาก token "ปลอม" ที่สร้างโดยโมเดลตัวสร้างขนาดเล็ก
- DeBERTa (2020): นำเสนอกลไก "การสนใจแบบแยกส่วน" (disentangled attention) ซึ่งเข้ารหัสเนื้อหาและตำแหน่งสัมพัทธ์ของ token แยกจากกัน
ดูเพิ่มเติม
- BERT