Theoretical foundations of large language models — รากฐานทางทฤษฎีของ LLM
รากฐานทางทฤษฎีของโมเดลภาษาขนาดใหญ่ (บนพื้นฐานสถาปัตยกรรม transformer) — คือกลุ่มของหลักการทางคณิตศาสตร์ สถิติ และทฤษฎีสารสนเทศ ที่เป็นรากฐานของการทำงาน การเรียนรู้ และความสามารถของโมเดลภาษาขนาดใหญ่ (LLM) ในยุคปัจจุบัน หลักการเหล่านี้อธิบายว่าโมเดลที่สร้างบนสถาปัตยกรรม Transformer สามารถเข้าใจและสร้างภาษามนุษย์ได้อย่างมีความสอดคล้องในระดับสูงได้อย่างไร
รากฐานสถาปัตยกรรม: สถาปัตยกรรม Transformer
LLM ในยุคปัจจุบันอิงอยู่บนสถาปัตยกรรม Transformer เกือบทั้งหมด ซึ่งถูกนำเสนอในปี ค.ศ. 2017 ในบทความ «Attention Is All You Need» สถาปัตยกรรมนี้ละทิ้งชั้น recurrent (เช่นใน RNN และ LSTM) และหันมาพึ่งพากลไก attention แทน ซึ่งช่วยให้ประมวลผลลำดับข้อมูลที่ยาวได้อย่างมีประสิทธิภาพและสามารถประมวลผลแบบขนานได้
กลไก Self-Attention
นี่คือแกนกลางของสถาปัตยกรรม Transformer กลไก self-attention ช่วยให้โมเดลถ่วงน้ำหนักความสำคัญของแต่ละคำ (token) ในลำดับเทียบกับคำอื่น ๆ ทั้งหมดในลำดับเดียวกัน สำหรับแต่ละ token จะมีการสร้างเวกเตอร์สามตัว:
- Query (Q, คำถาม): เวกเตอร์ที่แทนคำปัจจุบัน
- Key (K, กุญแจ): เวกเตอร์ที่ใช้เปรียบเทียบกับ query จากคำอื่น ๆ
- Value (V, ค่า): เวกเตอร์ที่บรรจุข้อมูลของคำซึ่งจะถูกส่งต่อไป
คะแนน attention คำนวณได้จากผลคูณเชิงสเกลาร์แบบปรับขนาด:
โดยที่ คือมิติของเวกเตอร์ key กลไกนี้ช่วยให้โมเดลจับความสัมพันธ์เชิงบริบทที่ซับซ้อนได้โดยไม่คำนึงถึงระยะห่างระหว่างคำ
Multi-Head Attention คือการรันการคำนวณดังกล่าวแบบขนานหลายชุดพร้อมกันด้วย projection matrix ที่แตกต่างกัน ซึ่งช่วยให้โมเดลโฟกัสที่แง่มุมต่าง ๆ ของไวยากรณ์และความหมายได้พร้อมกัน
ประเภทสถาปัตยกรรมบนพื้นฐาน Transformer
มีรูปแบบหลักสามแบบในการใช้ส่วนประกอบของ Transformer:
- Encoder-Decoder: สถาปัตยกรรมแบบดั้งเดิมสำหรับงานแปลงลำดับเป็นลำดับ (เช่น การแปลภาษา) encoder ประมวลผลลำดับอินพุต ส่วน decoder สร้างลำดับเอาต์พุต ตัวอย่าง: T5, BART
- Encoder-Only: โมเดลที่ใช้เฉพาะสแตก encoder เหมาะอย่างยิ่งสำหรับงานที่ต้องการความเข้าใจเชิงบริบทของทั้งลำดับอย่างลึกซึ้ง (การจำแนกข้อความ การรู้จำหน่วยที่มีชื่อ) ตัวอย่าง: BERT
- Decoder-Only: โมเดลที่ใช้เฉพาะสแตก decoder โมเดลเหล่านี้ทำงานแบบ autoregressive โดยทำนาย token ถัดไปจาก token ก่อนหน้า นี่คือมาตรฐานสำหรับโมเดล generative ตัวอย่าง: GPT, LLaMA, Claude
Positional Encoding
เนื่องจากกลไก self-attention ไม่ได้คำนึงถึงลำดับของคำ จึงมีการเพิ่ม positional encoding เข้าไปในสถาปัตยกรรม โดยเวกเตอร์ที่เข้ารหัสตำแหน่งในลำดับจะถูกบวกรวมเข้ากับ embedding ของ token ในโมเดลดั้งเดิมใช้ฟังก์ชัน sinusoidal:
ในโมเดลยุคใหม่ยังมีการใช้ positional encoding แบบที่เรียนรู้ได้และแบบ rotary (Rotary Position Embeddings, RoPE) อีกด้วย
หลักการเรียนรู้: จากความน่าจะเป็นสู่การเพิ่มประสิทธิภาพ
การสร้างแบบจำลองภาษาในฐานะปัญหาเชิงความน่าจะเป็น
รากฐานของ LLM คืองาน language modeling — การทำนายความน่าจะเป็นของลำดับข้อความ ในเชิงรูปนัย สำหรับลำดับ โมเดลประมาณค่าความน่าจะเป็น ด้วยกฎลูกโซ่ของความน่าจะเป็น สิ่งนี้สามารถกระจายออกเป็นผลคูณของความน่าจะเป็นแบบมีเงื่อนไข:
ดังนั้น การเรียนรู้ของโมเดลจึงลดรูปเหลือการทำนาย token ถัดไป โดยอาศัยบริบทจาก token ก่อนหน้า
ฟังก์ชันการสูญเสียและทฤษฎีสารสนเทศ
สำหรับการประเมินคุณภาพการทำนายและการเรียนรู้ของโมเดล จะใช้ ฟังก์ชันการสูญเสียแบบ cross-entropy ซึ่งวัดความแตกต่างระหว่างการกระจายความน่าจะเป็นที่โมเดลทำนาย () กับการกระจายจริง () ที่ token ถัดไปที่ถูกต้องมีความน่าจะเป็นเป็น 1 ส่วนที่เหลือเป็น 0
การลดค่า cross-entropy นั้นเทียบเท่ากับการเพิ่มความน่าจะเป็นสูงสุดของข้อมูลเรียนรู้
เมตริกคุณภาพที่เกี่ยวข้องคือ perplexity ซึ่งนิยามเป็น exponential ของ cross-entropy: โดยสัญชาตญาณ perplexity แสดงจำนวนตัวเลือกเฉลี่ยที่โมเดล «เลือก» ในแต่ละขั้นตอน ยิ่ง perplexity ต่ำ โมเดลก็ยิ่งมั่นใจและแม่นยำมากขึ้น
การเพิ่มประสิทธิภาพ
การเรียนรู้ LLM คือกระบวนการลดฟังก์ชันการสูญเสียโดยการปรับพารามิเตอร์หลายพันล้านตัวของโมเดล สำหรับสิ่งนี้จะใช้วิธีที่อิงอยู่บน gradient descent ที่ได้รับความนิยมมากที่สุดคือ optimizer Adam (Adaptive Moment Estimation) และรูปแบบต่าง ๆ (เช่น AdamW) ซึ่งปรับอัตราการเรียนรู้อย่างปรับตัวได้สำหรับแต่ละพารามิเตอร์
กรอบแนวทางการเรียนรู้
- Pre-training (การเรียนรู้ล่วงหน้า): โมเดลเรียนรู้จากคลังข้อความขนาดใหญ่ที่ไม่มีการติดป้ายกำกับ (Common Crawl, The Pile, C4) โดยใช้งาน self-supervised เช่น:
- Causal Language Modeling (CLM): การทำนาย token ถัดไป (ใช้ใน GPT)
- Masked Language Modeling (MLM): การกู้คืน token ที่ถูกซ่อนแบบสุ่มในข้อความ (ใช้ใน BERT)
- Fine-tuning (การปรับแต่ง): หลังจาก pre-training โมเดลจะถูกปรับให้เข้ากับงานเฉพาะด้วยชุดข้อมูลที่มีป้ายกำกับขนาดเล็ก
- Alignment (การปรับให้สอดคล้อง): ขั้นตอน fine-tuning พิเศษที่มุ่งปรับพฤติกรรมของโมเดลให้สอดคล้องกับค่านิยมและความต้องการของมนุษย์ วิธีหลักคือ RLHF (Reinforcement Learning from Human Feedback) ซึ่งโมเดลถูก fine-tune โดยใช้สัญญาณรางวัลจากโมเดลที่ทำนายความต้องการของมนุษย์
กฎการปรับขนาดและความสามารถเชิง Emergent
การวิจัยเชิงประจักษ์แสดงให้เห็นว่าประสิทธิภาพของ LLM ดีขึ้นอย่างคาดเดาได้เมื่อเพิ่มสามปัจจัย ได้แก่ ขนาดโมเดล (จำนวนพารามิเตอร์ ) ขนาดชุดข้อมูลเรียนรู้ () และปริมาณการคำนวณ () ความสัมพันธ์นี้อธิบายด้วย กฎกำลัง (scaling laws)
กฎที่เสนอในงานของ OpenAI (Kaplan et al., 2020) แสดงว่าฟังก์ชันการสูญเสีย ลดลงในรูปฟังก์ชันกำลังจาก , และ งานในภายหลังของ DeepMind (Hoffmann et al., 2022) ได้ปรับปรุงกฎเหล่านี้ (กฎ Chinchilla) โดยแสดงให้เห็นว่าการเรียนรู้ที่เหมาะสมที่สุดต้องเพิ่มทั้งขนาดโมเดลและปริมาณข้อมูลอย่างสมดุล
ผลสำคัญที่ตามมาจากการปรับขนาดคือการเกิดขึ้นของ ความสามารถเชิง emergent — การกระโดดเชิงคุณภาพในประสิทธิภาพเมื่อโมเดลเริ่มสามารถแก้ปัญหาที่ไม่ได้รับการเรียนรู้โดยตรง (เช่น เลขคณิต การใช้เหตุผลเชิงตรรกะ การเขียนโค้ด) ความสามารถเหล่านี้โดยทั่วไปไม่ปรากฏในโมเดลขนาดเล็กและจะแสดงออกเมื่อถึงเกณฑ์ขนาดที่กำหนดเท่านั้น
การสร้างข้อความ: กลยุทธ์การ Decoding
หลังจากการเรียนรู้ โมเดลสร้างข้อความโดยทำนาย token ถัดไปซ้ำ ๆ การเลือก token ถัดไปจากการกระจายความน่าจะเป็นที่โมเดลให้มานั้นทำได้ด้วย กลยุทธ์การ decoding หลากหลาย:
- Greedy Search (การค้นหาแบบโลภ): เลือก token ที่มีความน่าจะเป็นสูงสุดเสมอ รวดเร็วแต่มักให้ข้อความที่ซ้ำซากและน่าเบื่อ
- Beam Search (การค้นหาแบบ beam): ในแต่ละขั้นตอนจะเก็บลำดับที่มีความน่าจะเป็นสูงสุด ลำดับไว้ ช่วยให้ค้นหาคำตอบที่ดีกว่าในระดับโลกได้
- การสุ่มตัวอย่างด้วย temperature: ความน่าจะเป็นของ token ถูกปรับด้วยพารามิเตอร์ temperature () เมื่อ การกระจายจะสม่ำเสมอขึ้น (ความคิดสร้างสรรค์มากขึ้น) เมื่อ จะแหลมขึ้น (ความสุ่มน้อยลง)
- Top-k sampling: ในแต่ละขั้นตอน การสุ่มตัวอย่างจำกัดอยู่ที่ token ที่มีความน่าจะเป็นสูงสุด
- Top-p (Nucleus) sampling: การสุ่มตัวอย่างจำกัดอยู่ที่ชุด token ที่เล็กที่สุดซึ่งมีผลรวมความน่าจะเป็นเกินเกณฑ์ ซึ่งช่วยให้ปรับขนาดกลุ่มผู้สมัครได้แบบไดนามิก
ปัญหาและข้อจำกัดทางทฤษฎี
- Hallucination (การสร้างข้อมูลเท็จ): แนวโน้มของโมเดลที่จะสร้างข้อมูลที่ไม่ถูกต้องตามข้อเท็จจริงแต่ฟังดูน่าเชื่อ สิ่งนี้เกี่ยวข้องกับการที่โมเดลเพิ่มประสิทธิภาพความน่าจะเป็นของข้อความ ไม่ใช่ความเป็นจริงของข้อความ
- Bias (อคติ): LLM สืบทอดและขยายอคติทางสังคม วัฒนธรรม และอคติอื่น ๆ ที่มีอยู่ในข้อมูลเรียนรู้
- ความสามารถในการตีความ («กล่องดำ»): เนื่องจากจำนวนพารามิเตอร์มหาศาล จึงเป็นการยากมากที่จะเข้าใจว่าโมเดลตัดสินใจอย่างไร ซึ่งทำให้การแก้ไขข้อบกพร่องเป็นเรื่องยากและก่อให้เกิดความเสี่ยง
- ความซับซ้อนในการคำนวณ: กลไก self-attention มีความซับซ้อนกำลังสองตามความยาวของลำดับ () ซึ่งจำกัดความยาวสูงสุดของบริบทที่ประมวลผลได้
ดูเพิ่มเติม
- โมเดลภาษาขนาดใหญ่
- BERT
- GPT
เอกสารอ้างอิง
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Brown, T. B. et al. (2020). Language Models Are Few-Shot Learners. arXiv:2005.14165.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
- Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
- Bubeck, S. et al. (2023). Sparks of Artificial General Intelligence: Early Experiments with GPT-4. arXiv:2303.12712.
- Touvron, H. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. DOI:10.1145/3442188.3445922.