Decoder-only models (architecture) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

โมเดลที่ใช้เฉพาะตัวถอดรหัส (อังกฤษ: Decoder-Only Models) — คือกลุ่มสถาปัตยกรรมชั้นนำของโมเดลภาษาขนาดใหญ่ (LLM) ที่ใช้เฉพาะส่วน ถอดรหัส (decoder) ของสถาปัตยกรรม Transformer เท่านั้น โมเดลเหล่านี้เชี่ยวชาญด้านงาน การสร้างข้อความ และเป็นรากฐานของแชตบอตและผู้ช่วย AI สมัยใหม่ส่วนใหญ่

กลุ่มโมเดลชั้นนำที่ทำให้แนวทางนี้เป็นที่นิยม คือชุดโมเดล GPT จาก OpenAI

แนวคิดและสถาปัตยกรรม

แนวคิดหลักของโมเดลที่ใช้เฉพาะตัวถอดรหัสคือ การสร้างลำดับแบบ autoregressive ซึ่งหมายความว่าโมเดลจะทำนาย token ถัดไปโดยอาศัยทุก token ก่อนหน้าที่ถูกสร้างขึ้นมาแล้ว prompt ของผู้ใช้ (คำขอ) และข้อความที่สร้างขึ้นแล้วจะถูกมองเป็นลำดับเดียวที่โมเดลต่อเนื่องออกไป

ในเชิงสถาปัตยกรรม โมเดลประกอบด้วยชั้น decoder ที่เหมือนกัน N ชั้นซ้อนกัน แต่ละชั้น ต่างจาก encoder หรือ decoder แบบสมบูรณ์ มีเพียงสองชั้นย่อยหลัก:

  1. Masked Multi-Head Self-Attention (การให้ความสนใจตัวเองแบบหลายหัวพร้อมการปิดบัง): นี่คือกลไกสำคัญที่รับประกันคุณสมบัติ autoregressive ในระหว่างการประมวลผลลำดับ causal mask พิเศษจะป้องกันไม่ให้แต่ละ token "มองดู" token ที่ตามมาได้ ดังนั้นการทำนายสำหรับตำแหน่ง i จึงขึ้นอยู่กับ token ในตำแหน่ง <i เท่านั้น
  2. Feed-Forward Network (เครือข่ายประสาทแบบเชื่อมต่อเต็มรูปแบบ): ใช้การแปลงแบบไม่เชิงเส้นกับการแสดงแทนของแต่ละ token

ในโมเดลที่ใช้เฉพาะตัวถอดรหัสจะไม่มีกลไก cross-attention เนื่องจากไม่มี encoder ที่จะ "ให้ความสนใจ" ได้

งานการเรียนรู้เบื้องต้น

โมเดลที่ใช้เฉพาะตัวถอดรหัสได้รับการฝึกด้วยงานเดียวแต่ทรงพลังมากในรูปแบบ self-supervised:

Causal Language Modeling (CLM) - การสร้างแบบจำลองภาษาเชิงเหตุปัจจัย

  • หลักการทำงาน: โมเดลได้รับการฝึกให้ทำนาย token ถัดไปในลำดับ ในแต่ละขั้นตอนของการฝึก โมเดลจะรับข้อความส่วนหนึ่งเป็นอินพุตและต้องสร้างการกระจายความน่าจะเป็นสำหรับ token ถัดไป
  • เป้าหมาย: เพิ่มความน่าจะเป็นของ token ถัดไปที่ถูกต้องให้สูงสุดด้วยข้อมูลข้อความจำนวนมหาศาล งานที่ดูเรียบง่ายนี้บังคับให้โมเดลเรียนรู้ไวยากรณ์ วากยสัมพันธ์ ข้อเท็จจริงเกี่ยวกับโลก และรูปแบบที่ซับซ้อนของภาษา

การประยุกต์ใช้งาน

ด้วยธรรมชาติ autoregressive โมเดลที่ใช้เฉพาะตัวถอดรหัสเหมาะสมอย่างยิ่งสำหรับงานที่ต้องการการสร้างข้อความทุกประเภท:

  • การสร้างข้อความอิสระ: การเขียนบทความ บทกวี บทภาพยนตร์ ฯลฯ
  • ระบบสนทนาและแชตบอต: การตอบคำถามของผู้ใช้ในรูปแบบการสนทนา
  • การสรุปความ: การสร้างเนื้อหาย่อของข้อความยาว
  • การแปลด้วยเครื่อง: แม้ว่างานนี้มักจะใช้โมเดลแบบ encoder-decoder แต่โมเดลที่ใช้เฉพาะตัวถอดรหัสก็สามารถแปลได้เช่นกัน หากงานถูกระบุใน prompt (เช่น "แปลจากภาษาอังกฤษเป็นภาษาไทย: ...")
  • การเขียนโค้ด: การสร้างโค้ดจากคำอธิบายข้อความ
  • In-context learning - การเรียนรู้ในบริบท: ด้วยขนาดที่ใหญ่โต โมเดล decoder ขนาดใหญ่แสดงให้เห็นความสามารถในการแก้ปัญหาใหม่ด้วยตัวอย่างเพียงไม่กี่ตัวอย่าง (few-shot) หรือแม้กระทั่งไม่มีเลย (zero-shot) โดยตรงใน prompt โดยไม่ต้องทำ fine-tuning

โมเดลหลักและวิวัฒนาการของพวกมัน

  • ชุดโมเดล GPT (ปี 2018 - ปัจจุบัน): ผู้บุกเบิกและผู้ทำให้แนวทางนี้เป็นที่นิยม GPT-1 แสดงให้เห็นประสิทธิภาพของการฝึกเบื้องต้น GPT-2 แสดงพลังของการขยายขนาด และ GPT-3 แสดงการเกิดขึ้นของความสามารถ few-shot ส่วน ChatGPT และ GPT-4 ได้ทำให้สถาปัตยกรรมนี้กลายเป็นมาตรฐานสำหรับผู้ช่วย AI
  • LLaMA (ปี 2023 - ปัจจุบัน): ชุดโมเดลเปิดจาก Meta ที่ทำให้การเข้าถึง LLM ที่ทรงพลังเป็นเรื่องของคนทั่วไปและกระตุ้นคลื่นแห่งนวัตกรรมในชุมชน
  • Claude (ปี 2023 - ปัจจุบัน): กลุ่มโมเดลจาก Anthropic ที่มุ่งเน้นด้านความปลอดภัยและการควบคุมด้วย Constitutional AI
  • PaLM และ Gemini (ปี 2022 - ปัจจุบัน): โมเดลชั้นนำของ Google โดย Gemini ยังเป็นโมเดลที่ใช้เฉพาะตัวถอดรหัสแบบ multimodal โดยกำเนิดอีกด้วย

การเปรียบเทียบกับสถาปัตยกรรมอื่น

การเปรียบเทียบสถาปัตยกรรมหลักบนพื้นฐาน Transformer
สถาปัตยกรรม งานหลัก ทิศทางของบริบท โมเดลที่เป็นตัวแทน
เฉพาะตัวถอดรหัส (Decoder-only) การสร้างข้อความ ทิศทางเดียว (จากซ้ายไปขวา) GPT, LLaMA, Claude, Gemini
เฉพาะตัวเข้ารหัส (Encoder-only) การทำความเข้าใจข้อความ สองทิศทาง BERT, RoBERTa
ตัวเข้ารหัส-ตัวถอดรหัส (Encoder-decoder) การแปลงลำดับเป็นลำดับ สองทิศทาง (encoder) + ทิศทางเดียว (decoder) T5, BART, Transformer ต้นฉบับ

ดูเพิ่มเติม

  • GPT