Chinchilla (language model) (TH)
Chinchilla — คือโมเดลภาษาขนาดใหญ่ (LLM) ที่พัฒนาโดยทีมวิจัยของ DeepMind และเปิดตัวในเดือนมีนาคม ปี 2022[1] โมเดลนี้มีพารามิเตอร์ประมาณ 70,000 ล้าน ตัว และได้รับการฝึกบน corpus ข้อความขนาด 1.4 ล้านล้าน token
คุณลักษณะสำคัญของ Chinchilla คือแนวทางการฝึกที่เหมาะสมเชิงคำนวณ (compute-optimal) แตกต่างจากโมเดลก่อนหน้าที่เน้นการเพิ่มจำนวนพารามิเตอร์เป็นหลัก Chinchilla ถูกสร้างขึ้นบนสมมติฐานที่ว่าการขยายขนาดโมเดลและปริมาณข้อมูลฝึกควรดำเนินการอย่าง สมดุลและสัดส่วน ด้วยแนวทางนี้ Chinchilla แสดงให้เห็นถึงประสิทธิภาพที่เหนือกว่าโมเดลที่มีขนาดใหญ่กว่าอย่างมีนัยสำคัญ เช่น Gopher (280,000 ล้านพารามิเตอร์) และ GPT-3 (175,000 ล้านพารามิเตอร์) ในงานด้านภาษาที่หลากหลาย[2]
ที่มาและประวัติการพัฒนา
การพัฒนา Chinchilla เป็นผลจากการวิจัยการขยายขนาด (scaling) ของ LLM ที่ดำเนินการใน DeepMind โดยอิงจากตระกูลโมเดล Gopher[3] โมเดล Gopher ซึ่งเปิดตัวในปี 2021 มีพารามิเตอร์ 280,000 ล้านตัว แต่ได้รับการฝึกบน corpus ที่ค่อนข้างเล็กเพียง 300,000 ล้าน token ในช่วงเวลานั้น แนวทางที่ครองอุตสาหกรรมคือการเพิ่มประสิทธิภาพของโมเดลด้วยการขยายขนาด (จำนวนพารามิเตอร์) เป็นหลัก ในขณะที่ปริมาณข้อมูลยังคงค่อนข้างคงที่
สมมติฐานเรื่องการฝึกที่เหมาะสมเชิงคำนวณ
นักวิจัยของ DeepMind ตั้งสมมติฐานว่าโมเดลขนาดใหญ่หลายตัว รวมถึง Gopher นั้น ฝึกไม่เพียงพอ (undertrained) เมื่อเทียบกับขนาดของตน โมเดลเหล่านี้ไม่บรรลุคุณภาพสูงสุดที่เป็นไปได้ภายใต้งบประมาณการคำนวณที่กำหนด เนื่องจากขาดข้อมูลสำหรับการฝึก[2]
หัวใจสำคัญของสมมติฐานคือ เพื่อใช้ทรัพยากรการคำนวณอย่างเหมาะสมที่สุด ขนาดโมเดลและปริมาณข้อมูลฝึกควรเพิ่มขึ้นอย่าง สัดส่วน ต่อกัน กล่าวอีกนัยหนึ่ง เมื่อเพิ่มจำนวนพารามิเตอร์ของโมเดลเป็นสองเท่า ก็ควรเพิ่มจำนวน token สำหรับการฝึกเป็นสองเท่าด้วย[1] ข้อสรุปนี้ขัดแย้งกับงานวิจัยก่อนหน้าที่ประเมินคุณค่าของการเพิ่มขนาดโมเดลสูงเกินไป เนื่องจากงานวิจัยเหล่านั้นดำเนินการโดยคงปริมาณข้อมูลไว้คงที่
เพื่อทดสอบสมมติฐานนี้ ทีม DeepMind ได้ดำเนินการทดลองอย่างกว้างขวาง โดยฝึกโมเดลกว่า 400 ตัวที่มีขนาดต่างกัน บน dataset ตั้งแต่ 5,000 ล้านถึง 500,000 ล้าน token ผลลัพธ์ยืนยันว่าการขยายขนาดแบบขนานคือกลยุทธ์ที่เหมาะสมที่สุด จากข้อสรุปเหล่านี้ จึงได้พัฒนาโมเดล Chinchilla ขึ้นเป็นการทดสอบเชิงปฏิบัติของกระบวนทัศน์ใหม่[4]
สถาปัตยกรรมและการฝึก
ลักษณะเฉพาะด้านสถาปัตยกรรม
Chinchilla จัดอยู่ในตระกูล autoregressive transformer และมีสถาปัตยกรรมใกล้เคียงกับโมเดล GPT-2/GPT-3[3] โมเดลนี้รับช่วงต่อการออกแบบหลายอย่างจาก Gopher แต่มีความแตกต่างสำคัญที่มุ่งลดขนาดพร้อมรักษาความลึกของเครือข่ายไว้:
- พารามิเตอร์: ~70,000 ล้านพารามิเตอร์ กระจายอยู่ใน 80 เลเยอร์
- ความกว้างของโมเดล: จำนวน self-attention head ลดลงเหลือ 64 (เทียบกับ 128 ใน Gopher) และมิติภายในของเลเยอร์ลดลงเหลือ 8192 (เทียบกับ ~16384 ใน Gopher)
- Optimizer: ใช้ AdamW แทน Adam ซึ่งช่วยปรับปรุงการ convergence บน dataset ขนาดใหญ่[3]
สถาปัตยกรรมนี้ทำให้ Chinchilla รักษาความลึกของเครือข่ายในระดับเดียวกับ Gopher แต่ด้วยจำนวนพารามิเตอร์ที่น้อยกว่าอย่างมีนัยสำคัญ ส่งผลให้ลดความต้องการหน่วยความจำและทรัพยากรการคำนวณลงได้
การขยายขนาดและข้อมูลสำหรับการฝึก
เพื่อทดสอบสมมติฐาน Chinchilla ได้รับการฝึกด้วยงบประมาณการคำนวณเดียวกับ Gopher แต่มีการจัดสรรทรัพยากรใหม่เพื่อเน้นไปที่ข้อมูล โมเดลขนาด 70,000 ล้านพารามิเตอร์ได้รับการฝึกบน corpus ขนาด 1.4 ล้านล้าน token ซึ่งมากกว่าปริมาณข้อมูลที่ใช้สำหรับ Gopher ประมาณ 4 เท่า[1]
อัตราส่วนนี้ ซึ่งอยู่ที่ประมาณ 20 token ต่อพารามิเตอร์หนึ่งตัว เป็นที่รู้จักในชื่อ Chinchilla Point และใช้เป็นแนวทางสำหรับการฝึก LLM สมัยใหม่อย่างเหมาะสมเชิงคำนวณ[5] การทดลองยืนยันว่า Chinchilla ซึ่งได้รับการฝึกใกล้เคียงกับขีดจำกัดที่เหมาะสมนี้ สามารถบรรลุศักยภาพของตนได้อย่างเต็มที่มากกว่าโมเดลที่ฝึกไม่เพียงพอ แม้ว่าโมเดลเหล่านั้นจะมีขนาดใหญ่กว่าก็ตาม
ผลลัพธ์และประสิทธิภาพ
ในชุดการทดสอบมาตรฐานที่หลากหลาย Chinchilla แสดงให้เห็นถึงความเหนือกว่าโมเดลก่อนหน้าอย่างมีนัยสำคัญ โมเดลนี้ไม่เพียงแต่เอาชนะ Gopher เท่านั้น แต่ยังเอาชนะ LLM ชั้นนำอื่น ๆ ในช่วงเวลานั้น รวมถึง OpenAI GPT-3 (175,000 ล้านพารามิเตอร์) และ Megatron-Turing NLG (530,000 ล้านพารามิเตอร์) อีกด้วย[1]
ผลลัพธ์ที่โดดเด่นที่สุดคือบน benchmark ครอบคลุม MMLU (Measuring Massive Multitask Language Understanding) ซึ่งประเมินความรู้และการใช้เหตุผลในงานที่หลากหลายหลายร้อยประเภท Chinchilla บรรลุความแม่นยำเฉลี่ย 67.5% ซึ่งเป็นสถิติใหม่สำหรับโมเดลในระดับนี้ และสูงกว่าผลลัพธ์ของ Gopher ถึง 7 เปอร์เซ็นต์[4]
นอกจากประสิทธิภาพที่สูงแล้ว Chinchilla ยังแสดงให้เห็นถึงความ ประหยัด ในการใช้งาน ขนาดโมเดลที่เล็กกว่า (70,000 ล้านเทียบกับ 175,000 ล้านขึ้นไปของโมเดลที่เทียบเคียงกัน) หมายความว่าต้องการทรัพยากรการคำนวณน้อยกว่าอย่างมากสำหรับ inference และ fine-tuning ซึ่งทำให้การนำไปใช้งานจริงทำได้ง่ายขึ้น
ความสำคัญและอิทธิพล
การวิจัย Chinchilla ส่งผลกระทบเชิงพื้นฐานต่อแนวทางการฝึกโมเดลภาษาขนาดใหญ่
- กฎการขยายขนาดของ Chinchilla (Chinchilla scaling laws): อัตราส่วนที่เหมาะสมระหว่างขนาดโมเดลและปริมาณข้อมูลที่ค้นพบ กลายเป็นมาตรฐานโดยพฤตินัยและแนวทางสำหรับการพัฒนาในอุตสาหกรรมในเวลาต่อมา
- การเปลี่ยนโฟกัสจากขนาดไปสู่ข้อมูล: งานนี้กระตุ้นให้อุตสาหกรรมหันมาให้ความสำคัญกับการสร้าง ทำความสะอาด และขยาย corpus สำหรับการฝึก มากกว่าการเพิ่มจำนวนพารามิเตอร์อย่างไม่เลือกสรร
- การประยุกต์ใช้ในระบบ multimodal: Chinchilla ถูกนำมาใช้เป็นส่วนประกอบภาษาหลักในโมเดล multimodal ของ DeepMind ชื่อ Flamingo ซึ่งสามารถเข้าใจทั้งภาพและข้อความ[6]
แม้ว่าตัวโมเดล Chinchilla เองจะไม่ได้เปิดให้สาธารณชนเข้าถึง แต่แนวคิดและผลลัพธ์ที่ตีพิมพ์ในงานวิจัยได้เปลี่ยนทิศทางการพัฒนาของสาขา LLM ทั้งหมด โดยชี้ให้เห็นเส้นทางสู่การเติบโตของขีดความสามารถของปัญญาประดิษฐ์ที่มีประสิทธิภาพและสมดุลยิ่งขึ้น
บรรณานุกรม
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Loshchilov, I.; Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Kaplan, J.; et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Brown, T. B.; et al. (2020). Language Models are Few‑Shot Learners. arXiv:2005.14165.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Rae, J.; et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Hoffmann, J.; et al. (2022). Training Compute‑Optimal Large Language Models. arXiv:2203.15556.
- Alayrac, J.‑B.; et al. (2022). Flamingo: A Visual Language Model for Few‑Shot Learning. arXiv:2204.14198.
- Hendrycks, D.; et al. (2020). Measuring Massive Multitask Language Understanding. arXiv:2009.03300.
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 Hoffmann, J. et al. (2022). «Training Compute-Optimal Large Language Models». NeurIPS 2022. [1]
- ↑ 2.0 2.1 Wali, K. (2022). «DeepMind launches GPT-3 rival, Chinchilla». Analytics India Magazine. [2]
- ↑ 3.0 3.1 3.2 Rae, J. et al. (2022). «Scaling Language Models: Methods, Analysis & Insights from Training Gopher». arXiv:2112.11446.
- ↑ 4.0 4.1 «Training Compute-Optimal Large Language Models». proceedings.neurips.cc.
- ↑ «What is the Chinchilla Point ("Chinchilla Optimal")?». Legal Genie.
- ↑ «Chinchilla (language model)». Wikipedia.