Pre-training of large language models — การเรียนรู้เบื้องต้น
การเรียนรู้เบื้องต้นของโมเดลภาษาขนาดใหญ่ (LLM) — คือขั้นตอนพื้นฐานในการสร้างโมเดลภาษาขนาดใหญ่สมัยใหม่ ซึ่งประกอบด้วยการฝึกโมเดลบนชุดข้อมูลข้อความที่ไม่มีการติดป้ายกำกับจำนวนมหาศาลและหลากหลาย กระบวนการนี้ช่วยให้โมเดลสามารถเรียนรู้รูปแบบทางภาษาทั่วไป ความรู้เกี่ยวกับโลก และความสัมพันธ์เชิงความหมาย จนก่อให้เกิดสิ่งที่เรียกว่า โมเดลพื้นฐาน (foundation model) ซึ่งสามารถนำไปปรับใช้กับงานเฉพาะต่าง ๆ ได้ในภายหลัง
Pre-training คืออะไร?
การเรียนรู้เบื้องต้น (pre-training) คือระยะเริ่มต้นของการฝึก ซึ่ง LLM จะถูกฝึกบนชุดข้อมูลข้อความขนาดใหญ่โดยใช้วิธีการ self-supervised learning ซึ่งหมายความว่าสัญญาณการฝึก (ป้ายกำกับ) ถูกสร้างขึ้นจากข้อมูลนั้นเอง โดยไม่จำเป็นต้องให้มนุษย์ติดป้ายกำกับด้วยตนเอง
เป้าหมายหลักของขั้นตอนนี้คือการทำนายส่วนที่ซ่อนอยู่หรือส่วนที่ยังไม่มาถึงของข้อความ ขึ้นอยู่กับสถาปัตยกรรม จะใช้งานหลักสองประเภท:
- Causal Language Modeling (CLM): โมเดลเรียนรู้การทำนายคำ (token) ถัดไปในลำดับโดยอาศัยคำก่อนหน้าทั้งหมด แนวทางนี้เป็นรากฐานของโมเดลเชิงสร้าง (generative) เช่น GPT
- Masked Language Modeling (MLM): โมเดลเรียนรู้การกู้คืนคำที่ถูก "ปิดบัง" (ซ่อน) แบบสุ่มในข้อความ โดยใช้บริบทสองทิศทางรอบ ๆ คำเหล่านั้น (คำทางซ้ายและขวา) วิธีนี้ใช้ในโมเดลเช่น BERT
ด้วยงานเหล่านี้ โมเดลจึงถูกบังคับให้ศึกษาไวยากรณ์ ความหมาย และความรู้เชิงข้อเท็จจริงเกี่ยวกับโลก เพื่อให้การทำนายประสบความสำเร็จ
ข้อมูลสำหรับการเรียนรู้เบื้องต้น
ประสิทธิผลของการเรียนรู้เบื้องต้นขึ้นอยู่กับคุณภาพและความหลากหลายของข้อมูลการฝึกเป็นอย่างมาก แหล่งข้อมูลหลักที่ใช้มีดังต่อไปนี้:
- หน้าเว็บ: ชุดข้อมูลเช่น Common Crawl และ C4 ให้หัวข้อ สไตล์ และภาษาที่หลากหลาย โดยเป็นตัวแทน "ภาพถ่าย" ของอินเทอร์เน็ต
- หนังสือ: คลังข้อมูลเช่น BookCorpus และ The Pile มอบข้อความที่มีโครงสร้างและเชื่อมโยงกัน ซึ่งเป็นประโยชน์ต่อการทำความเข้าใจการพึ่งพาระยะยาวและเรื่องเล่า
- ข้อมูลการสนทนา: ข้อมูลจากฟอรัม (เช่น Reddit) และโซเชียลมีเดีย ซึ่งช่วยให้โมเดลเรียนรู้ภาษาที่ไม่เป็นทางการและรูปแบบการโต้ตอบ
- ข้อมูลเฉพาะทาง: บทความทางวิทยาศาสตร์ (จาก arXiv) โค้ดโปรแกรม (จาก GitHub และ The Stack) หรือข้อความหลายภาษาเพื่อพัฒนาความสามารถเฉพาะของโมเดล
ตัวอย่างการกระจายข้อมูล
โมเดลต่าง ๆ ใช้สัดส่วนของแหล่งข้อมูลที่แตกต่างกัน ซึ่งส่งผลต่อความสามารถขั้นสุดท้ายของแต่ละโมเดล:
- GPT-3 (175 พันล้านพารามิเตอร์):** หนังสือ 16%, หน้าเว็บ 84%
- PaLM (540 พันล้านพารามิเตอร์):** หนังสือ 5%, หน้าเว็บ 14%, ข้อมูลการสนทนา 50%, อื่น ๆ 31%
- LLaMA (65 พันล้านพารามิเตอร์):** หนังสือ 5%, หน้าเว็บ 2%, ข้อมูลการสนทนา 87%
การกระจายเหล่านี้แสดงให้เห็นว่าการเลือกข้อมูลเป็นการตัดสินใจเชิงกลยุทธ์ที่แตกต่างกันไปตามเป้าหมายของโมเดล
คลังข้อมูลที่ใช้บ่อย
| คลังข้อมูล | ขนาด | แหล่งที่มา | อัปเดตล่าสุด |
|---|---|---|---|
| BookCorpus | 5GB | หนังสือ | ธ.ค.-2015 |
| Gutenberg | - | หนังสือ | ธ.ค.-2021 |
| C4 | 800GB | Common Crawl | เม.ย.-2019 |
| CC-Stories-R | 31GB | Common Crawl | ก.ย.-2019 |
| CC-NEWS | 78GB | Common Crawl | ก.พ.-2019 |
| REALNEWS | 120GB | Common Crawl | เม.ย.-2019 |
| OpenWebText | 38GB | ลิงก์ Reddit | มี.ค.-2023 |
| Pushshift.io | 2TB | ลิงก์ Reddit | มี.ค.-2023 |
| Wikipedia | 21GB | วิกิพีเดีย | มี.ค.-2023 |
| The Pile | 800GB | อื่น ๆ | ธ.ค.-2020 |
| ROOTS | 1.6TB | อื่น ๆ | มิ.ย.-2022 |
เทคนิคการฝึก
การเรียนรู้เบื้องต้นของ LLM ต้องการทรัพยากรการคำนวณจำนวนมาก สำหรับการจัดการกระบวนการนี้ จะใช้เทคนิคต่อไปนี้:
- การฝึกแบบกระจาย (Distributed Training): การใช้ GPU หรือ TPU หลายตัวเพื่อประมวลผลแบบขนาน
- Mixed Precision: การใช้รูปแบบตัวเลขที่มีความแม่นยำต่ำกว่า (เช่น 16 บิตแทน 32 บิต) เพื่อเร่งการคำนวณและลดการใช้หน่วยความจำ
- Gradient Checkpointing: เทคนิคการประหยัดหน่วยความจำโดยการคำนวณใหม่แทนการจัดเก็บการกระตุ้นขั้นกลางบางส่วน
- Model Parallelism: การกระจายโมเดลเองไปยังหลายอุปกรณ์
การฝึกโมเดลอย่าง GPT-3 อาจใช้เวลาหลายเดือนบน GPU หลายพันตัว
กฎการปรับขนาด
การวิจัย เช่น งานของ OpenAI (Kaplan et al., 2020) แสดงให้เห็นว่าประสิทธิภาพของโมเดลภาษาปรับปรุงขึ้นอย่างคาดเดาได้เมื่อปัจจัยสามประการเพิ่มขึ้น:
- ขนาดของโมเดล (จำนวนพารามิเตอร์)
- ปริมาณข้อมูล
- ทรัพยากรการคำนวณ
ความสัมพันธ์เชิงประจักษ์เหล่านี้ที่รู้จักกันในชื่อ กฎการปรับขนาด (scaling laws) ทำหน้าที่เป็นแนวทางสำหรับนักพัฒนาในการออกแบบและฝึกโมเดลที่มีขนาดใหญ่และทรงพลังยิ่งขึ้น ช่วยให้สามารถจัดสรรงบประมาณการคำนวณได้อย่างเหมาะสมที่สุด
ความท้าทายและความสำเร็จ
- การปรับขนาด: ความสำเร็จหลักของการเรียนรู้เบื้องต้นคือความสามารถในการสร้างสมดุลระหว่างขนาดโมเดล ข้อมูล และการคำนวณเพื่อให้ได้ประสิทธิภาพที่เหมาะสมที่สุด
- คุณภาพข้อมูล: การรับประกันความสะอาด ความหลากหลาย และการปราศจากอคติในข้อมูลการฝึกเป็นความท้าทายสำคัญ
- ประสิทธิภาพ: การพัฒนาวิธีการลดต้นทุนการคำนวณ เช่น การเรียนรู้เบื้องต้นแบบต่อเนื่องหรือสถาปัตยกรรมที่มีประสิทธิภาพมากขึ้น
- ความสามารถหลายภาษา: การสร้างโมเดลที่สามารถประมวลผลหลายภาษาได้อย่างมีประสิทธิภาพต้องอาศัยการคัดเลือกและสร้างสมดุลข้อมูลอย่างรอบคอบ
ดูเพิ่มเติม
- โมเดลภาษาขนาดใหญ่
- BERT
- GPT