Pre-training of large language models — การเรียนรู้เบื้องต้น

From Systems analysis Wiki
Jump to navigation Jump to search

การเรียนรู้เบื้องต้นของโมเดลภาษาขนาดใหญ่ (LLM) — คือขั้นตอนพื้นฐานในการสร้างโมเดลภาษาขนาดใหญ่สมัยใหม่ ซึ่งประกอบด้วยการฝึกโมเดลบนชุดข้อมูลข้อความที่ไม่มีการติดป้ายกำกับจำนวนมหาศาลและหลากหลาย กระบวนการนี้ช่วยให้โมเดลสามารถเรียนรู้รูปแบบทางภาษาทั่วไป ความรู้เกี่ยวกับโลก และความสัมพันธ์เชิงความหมาย จนก่อให้เกิดสิ่งที่เรียกว่า โมเดลพื้นฐาน (foundation model) ซึ่งสามารถนำไปปรับใช้กับงานเฉพาะต่าง ๆ ได้ในภายหลัง

Pre-training คืออะไร?

การเรียนรู้เบื้องต้น (pre-training) คือระยะเริ่มต้นของการฝึก ซึ่ง LLM จะถูกฝึกบนชุดข้อมูลข้อความขนาดใหญ่โดยใช้วิธีการ self-supervised learning ซึ่งหมายความว่าสัญญาณการฝึก (ป้ายกำกับ) ถูกสร้างขึ้นจากข้อมูลนั้นเอง โดยไม่จำเป็นต้องให้มนุษย์ติดป้ายกำกับด้วยตนเอง

เป้าหมายหลักของขั้นตอนนี้คือการทำนายส่วนที่ซ่อนอยู่หรือส่วนที่ยังไม่มาถึงของข้อความ ขึ้นอยู่กับสถาปัตยกรรม จะใช้งานหลักสองประเภท:

  • Causal Language Modeling (CLM): โมเดลเรียนรู้การทำนายคำ (token) ถัดไปในลำดับโดยอาศัยคำก่อนหน้าทั้งหมด แนวทางนี้เป็นรากฐานของโมเดลเชิงสร้าง (generative) เช่น GPT
  • Masked Language Modeling (MLM): โมเดลเรียนรู้การกู้คืนคำที่ถูก "ปิดบัง" (ซ่อน) แบบสุ่มในข้อความ โดยใช้บริบทสองทิศทางรอบ ๆ คำเหล่านั้น (คำทางซ้ายและขวา) วิธีนี้ใช้ในโมเดลเช่น BERT

ด้วยงานเหล่านี้ โมเดลจึงถูกบังคับให้ศึกษาไวยากรณ์ ความหมาย และความรู้เชิงข้อเท็จจริงเกี่ยวกับโลก เพื่อให้การทำนายประสบความสำเร็จ

ข้อมูลสำหรับการเรียนรู้เบื้องต้น

ประสิทธิผลของการเรียนรู้เบื้องต้นขึ้นอยู่กับคุณภาพและความหลากหลายของข้อมูลการฝึกเป็นอย่างมาก แหล่งข้อมูลหลักที่ใช้มีดังต่อไปนี้:

  • หน้าเว็บ: ชุดข้อมูลเช่น Common Crawl และ C4 ให้หัวข้อ สไตล์ และภาษาที่หลากหลาย โดยเป็นตัวแทน "ภาพถ่าย" ของอินเทอร์เน็ต
  • หนังสือ: คลังข้อมูลเช่น BookCorpus และ The Pile มอบข้อความที่มีโครงสร้างและเชื่อมโยงกัน ซึ่งเป็นประโยชน์ต่อการทำความเข้าใจการพึ่งพาระยะยาวและเรื่องเล่า
  • ข้อมูลการสนทนา: ข้อมูลจากฟอรัม (เช่น Reddit) และโซเชียลมีเดีย ซึ่งช่วยให้โมเดลเรียนรู้ภาษาที่ไม่เป็นทางการและรูปแบบการโต้ตอบ
  • ข้อมูลเฉพาะทาง: บทความทางวิทยาศาสตร์ (จาก arXiv) โค้ดโปรแกรม (จาก GitHub และ The Stack) หรือข้อความหลายภาษาเพื่อพัฒนาความสามารถเฉพาะของโมเดล

ตัวอย่างการกระจายข้อมูล

โมเดลต่าง ๆ ใช้สัดส่วนของแหล่งข้อมูลที่แตกต่างกัน ซึ่งส่งผลต่อความสามารถขั้นสุดท้ายของแต่ละโมเดล:

  • GPT-3 (175 พันล้านพารามิเตอร์):** หนังสือ 16%, หน้าเว็บ 84%
  • PaLM (540 พันล้านพารามิเตอร์):** หนังสือ 5%, หน้าเว็บ 14%, ข้อมูลการสนทนา 50%, อื่น ๆ 31%
  • LLaMA (65 พันล้านพารามิเตอร์):** หนังสือ 5%, หน้าเว็บ 2%, ข้อมูลการสนทนา 87%

การกระจายเหล่านี้แสดงให้เห็นว่าการเลือกข้อมูลเป็นการตัดสินใจเชิงกลยุทธ์ที่แตกต่างกันไปตามเป้าหมายของโมเดล

คลังข้อมูลที่ใช้บ่อย

ชุดข้อมูลที่ใช้บ่อยสำหรับการเรียนรู้เบื้องต้นของ LLM
คลังข้อมูล ขนาด แหล่งที่มา อัปเดตล่าสุด
BookCorpus 5GB หนังสือ ธ.ค.-2015
Gutenberg - หนังสือ ธ.ค.-2021
C4 800GB Common Crawl เม.ย.-2019
CC-Stories-R 31GB Common Crawl ก.ย.-2019
CC-NEWS 78GB Common Crawl ก.พ.-2019
REALNEWS 120GB Common Crawl เม.ย.-2019
OpenWebText 38GB ลิงก์ Reddit มี.ค.-2023
Pushshift.io 2TB ลิงก์ Reddit มี.ค.-2023
Wikipedia 21GB วิกิพีเดีย มี.ค.-2023
The Pile 800GB อื่น ๆ ธ.ค.-2020
ROOTS 1.6TB อื่น ๆ มิ.ย.-2022

เทคนิคการฝึก

การเรียนรู้เบื้องต้นของ LLM ต้องการทรัพยากรการคำนวณจำนวนมาก สำหรับการจัดการกระบวนการนี้ จะใช้เทคนิคต่อไปนี้:

  • การฝึกแบบกระจาย (Distributed Training): การใช้ GPU หรือ TPU หลายตัวเพื่อประมวลผลแบบขนาน
  • Mixed Precision: การใช้รูปแบบตัวเลขที่มีความแม่นยำต่ำกว่า (เช่น 16 บิตแทน 32 บิต) เพื่อเร่งการคำนวณและลดการใช้หน่วยความจำ
  • Gradient Checkpointing: เทคนิคการประหยัดหน่วยความจำโดยการคำนวณใหม่แทนการจัดเก็บการกระตุ้นขั้นกลางบางส่วน
  • Model Parallelism: การกระจายโมเดลเองไปยังหลายอุปกรณ์

การฝึกโมเดลอย่าง GPT-3 อาจใช้เวลาหลายเดือนบน GPU หลายพันตัว

กฎการปรับขนาด

การวิจัย เช่น งานของ OpenAI (Kaplan et al., 2020) แสดงให้เห็นว่าประสิทธิภาพของโมเดลภาษาปรับปรุงขึ้นอย่างคาดเดาได้เมื่อปัจจัยสามประการเพิ่มขึ้น:

  • ขนาดของโมเดล (จำนวนพารามิเตอร์)
  • ปริมาณข้อมูล
  • ทรัพยากรการคำนวณ

ความสัมพันธ์เชิงประจักษ์เหล่านี้ที่รู้จักกันในชื่อ กฎการปรับขนาด (scaling laws) ทำหน้าที่เป็นแนวทางสำหรับนักพัฒนาในการออกแบบและฝึกโมเดลที่มีขนาดใหญ่และทรงพลังยิ่งขึ้น ช่วยให้สามารถจัดสรรงบประมาณการคำนวณได้อย่างเหมาะสมที่สุด

ความท้าทายและความสำเร็จ

  • การปรับขนาด: ความสำเร็จหลักของการเรียนรู้เบื้องต้นคือความสามารถในการสร้างสมดุลระหว่างขนาดโมเดล ข้อมูล และการคำนวณเพื่อให้ได้ประสิทธิภาพที่เหมาะสมที่สุด
  • คุณภาพข้อมูล: การรับประกันความสะอาด ความหลากหลาย และการปราศจากอคติในข้อมูลการฝึกเป็นความท้าทายสำคัญ
  • ประสิทธิภาพ: การพัฒนาวิธีการลดต้นทุนการคำนวณ เช่น การเรียนรู้เบื้องต้นแบบต่อเนื่องหรือสถาปัตยกรรมที่มีประสิทธิภาพมากขึ้น
  • ความสามารถหลายภาษา: การสร้างโมเดลที่สามารถประมวลผลหลายภาษาได้อย่างมีประสิทธิภาพต้องอาศัยการคัดเลือกและสร้างสมดุลข้อมูลอย่างรอบคอบ

ดูเพิ่มเติม

  • โมเดลภาษาขนาดใหญ่
  • BERT
  • GPT