Encoder-only models — โมเดลเฉพาะตัวเข้ารหัส

From Systems analysis Wiki
Jump to navigation Jump to search

โมเดลเฉพาะตัวเข้ารหัส (อังกฤษ: Encoder-Only Models) — คือกลุ่มสถาปัตยกรรมของโมเดลภาษาขนาดใหญ่ (LLM) ที่ใช้เฉพาะส่วนเข้ารหัส (encoder) ของสถาปัตยกรรม Transformer เท่านั้น แตกต่างจากโมเดลที่ใช้ตัวถอดรหัสหรือสถาปัตยกรรม encoder-decoder แบบเต็มรูปแบบ โมเดลเหล่านี้เชี่ยวชาญด้านงานความเข้าใจภาษาธรรมชาติ (Natural Language Understanding, NLU).

โมเดลชั้นนำและผู้บุกเบิกแนวทางนี้คือ BERT (Bidirectional Encoder Representations from Transformers) ซึ่งพัฒนาโดย Google ในปี 2018

แนวคิดและสถาปัตยกรรม

แนวคิดหลักของโมเดลเฉพาะตัวเข้ารหัสคือการสร้างการแทนค่าเชิงบริบท (embedding) เชิงลึกสำหรับแต่ละ token ในลำดับอินพุต ด้วยกลไกการสนใจตัวเอง (self-attention) ใน Transformer แต่ละ token สามารถ "มองเห็น" และโต้ตอบกับ token อื่น ๆ ทั้งหมดในลำดับ ทำให้โมเดลสามารถจับบริบทที่สมบูรณ์ได้

คุณลักษณะสำคัญคือความเป็นสองทิศทาง: การแทนค่าของแต่ละ token ถูกสร้างจากทั้งบริบทด้านซ้ายและด้านขวาพร้อมกัน สิ่งนี้แตกต่างอย่างมากจากโมเดลเฉพาะตัวถอดรหัสแบบ autoregressive (เช่น GPT) ซึ่งโดยธรรมชาติแล้วเป็นแบบทิศทางเดียว

ในด้านสถาปัตยกรรม โมเดลประกอบด้วยชั้น encoder ที่เหมือนกัน N ชั้น แต่ละชั้นประกอบด้วยชั้นย่อยหลักสองชั้น:

  1. การสนใจตัวเองแบบหลายหัว (Multi-Head Self-Attention): คำนวณการแทนค่าเชิงบริบทสำหรับแต่ละ token
  2. โครงข่ายประสาทแบบเชื่อมต่อเต็มรูปแบบ (Feed-Forward Network): ใช้การแปลงแบบไม่เชิงเส้นกับการแทนค่าของแต่ละ token

ที่เอาต์พุต โมเดลจะสร้างลำดับของเวกเตอร์ที่มีความยาวเท่ากับลำดับอินพุต โดยแต่ละเวกเตอร์คือการแทนค่าที่สมบูรณ์ของ token อินพุตที่สอดคล้องกัน

งานการเรียนรู้ล่วงหน้า

เพื่อสอนให้โมเดลเข้าใจภาษาในบริบทแบบสองทิศทาง จะใช้งานการเรียนรู้ล่วงหน้าแบบ self-supervised เฉพาะทาง:

Masked Language Modeling - การสร้างแบบจำลองภาษาแบบปิดบัง (MLM)

นี่คืองานหลักและสำคัญที่สุดสำหรับโมเดลเฉพาะตัวเข้ารหัส ซึ่งนำเสนอครั้งแรกใน BERT

  • หลักการทำงาน: token จำนวนหนึ่งในลำดับอินพุตถูกซ่อน (ปิดบัง) แบบสุ่ม (โดยทั่วไปประมาณ 15%) งานของโมเดลคือการทำนายค่าเดิมของ token ที่ถูกปิดบังเหล่านั้น โดยใช้บริบทสองทิศทางที่ล้อมรอบ
  • เป้าหมาย: งานนี้บังคับให้โมเดลเรียนรู้ความสัมพันธ์ทางความหมายและวากยสัมพันธ์เชิงลึกระหว่างคำ

Next Sentence Prediction - การทำนายประโยคถัดไป (NSP)

งานนี้ (จาก BERT ต้นฉบับเช่นกัน) ได้รับการออกแบบเพื่อสอนให้โมเดลเข้าใจความสัมพันธ์ระหว่างประโยค

  • หลักการทำงาน: โมเดลได้รับคู่ประโยคและต้องระบุว่าประโยคที่สองเป็นการต่อเนื่องที่สมเหตุสมผลของประโยคแรกในข้อความต้นฉบับหรือไม่
  • สถานะ: ต่อมางานวิจัย (เช่น ในโมเดล RoBERTa) แสดงให้เห็นว่า NSP มีประสิทธิภาพน้อยกว่า MLM และมักถูกแทนที่ด้วยงานอื่นหรือถูกลบออกทั้งหมด

การประยุกต์ใช้งาน

โมเดลเฉพาะตัวเข้ารหัสไม่ได้ออกแบบมาเพื่อการสร้างข้อความแบบอิสระ เนื่องจากไม่มีตัวถอดรหัสแบบ autoregressive ความแข็งแกร่งของโมเดลอยู่ที่การวิเคราะห์และทำความเข้าใจข้อความ การแทนค่าเชิงเวกเตอร์เอาต์พุตของโมเดลถูกนำไปใช้แก้ปัญหางาน NLU หลากหลายประเภท:

  • การจำแนกข้อความ: สำหรับงานเช่นการวิเคราะห์ความรู้สึกหรือการระบุหัวข้อ จะใช้การแทนค่าของ token พิเศษ `[CLS]` ซึ่งเพิ่มไว้ที่ต้นของแต่ละลำดับ เวกเตอร์สุดท้ายของมันรวบรวมข้อมูลของลำดับทั้งหมด
  • การจำแนก token: สำหรับงานเช่นการรู้จำหน่วยที่มีชื่อ (NER) หรือการติดป้ายกำกับชนิดของคำ (POS-tagging) จะใช้การแทนค่าเชิงเวกเตอร์ของแต่ละ token แยกกัน
  • การตอบคำถาม (Question Answering): ในงานที่คำตอบเป็นส่วนหนึ่งของข้อความที่กำหนด (extractive QA) โมเดลได้รับการฝึกให้ทำนาย token เริ่มต้นและสิ้นสุดของคำตอบ
  • การรับ embedding: โมเดล encoder มักถูกใช้เป็นตัวเข้ารหัสข้อความอเนกประสงค์เพื่อรับ embedding คุณภาพสูงของประโยคหรือเอกสาร ซึ่งสามารถนำไปใช้ในระบบค้นหาหรืองานความคล้ายคลึงเชิงความหมายได้

โมเดลหลักและวิวัฒนาการ

  • BERT (2018): ผู้บุกเบิกสถาปัตยกรรม สร้างสถิติใหม่ใน NLP benchmark หลายรายการ
  • RoBERTa (2019): "BERT ที่ปรับแต่งอย่างมีประสิทธิภาพ" แสดงให้เห็นว่าประสิทธิภาพของ BERT สามารถปรับปรุงได้อย่างมากด้วยการฝึกที่นานขึ้นบนข้อมูลจำนวนมากขึ้นและการยกเลิกงาน NSP
  • ALBERT (2019): "A Lite BERT" โมเดลที่มีจำนวนพารามิเตอร์น้อยกว่าอย่างมีนัยสำคัญ ด้วยเทคนิคการแยกตัวประกอบ embedding และการแชร์พารามิเตอร์ระหว่างชั้น
  • DistilBERT (2019): เวอร์ชันที่ย่อขนาดของ BERT สร้างด้วยการกลั่นกรองความรู้ (knowledge distillation) ซึ่งเร็วและเบากว่า แต่ยังคงรักษาประสิทธิภาพส่วนใหญ่ของต้นฉบับไว้
  • ELECTRA (2020): นำเสนองานการเรียนรู้ล่วงหน้าที่มีประสิทธิภาพมากขึ้น — replaced token detection ซึ่งโมเดลเรียนรู้การแยกแยะ token ต้นฉบับจาก token "ปลอม" ที่สร้างโดยโมเดลตัวสร้างขนาดเล็ก
  • DeBERTa (2020): นำเสนอกลไก "การสนใจแบบแยกส่วน" (disentangled attention) ซึ่งเข้ารหัสเนื้อหาและตำแหน่งสัมพัทธ์ของ token แยกจากกัน

ดูเพิ่มเติม

  • BERT