PaLM (Pathways Language Model) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

PaLM (Pathways Language Model) — คือกลุ่มของ Large Language Model (LLM) ที่พัฒนาโดยบริษัท Google โดยเวอร์ชันแรกที่เปิดตัวในเดือนเมษายน ปี 2022 มีพารามิเตอร์ 540 พันล้านตัว และกลายเป็นหนึ่งใน Language Model ที่ใหญ่ที่สุดในโลก ณ ขณะนั้น พร้อมแสดงให้เห็นถึงความสามารถอันก้าวล้ำที่เกิดขึ้นจากการขยายขนาดอย่างมหาศาล[1]

รากฐานทางเทคโนโลยีที่สำคัญของ PaLM คือ Pathways — สถาปัตยกรรมใหม่สำหรับระบบ Machine Learning จาก Google ที่ช่วยให้สามารถประสานงานการคำนวณแบบกระจายบนชิปตัวเร่งความเร็วหลายพันตัวได้อย่างมีประสิทธิภาพ[2] PaLM เป็นการสาธิตขนาดใหญ่ครั้งแรกของระบบนี้ โดยแสดงให้เห็นถึงประสิทธิภาพการฝึกอบรมที่ไม่เคยมีมาก่อนในระดับขนาดมหาศาล

Pathways System - ระบบ Pathways: รากฐานสำหรับการขยายขนาด

แนวคิด Pathways ที่ Google นำเสนอในปี 2021 มุ่งสร้างเครือข่ายประสาทเทียมเดียวที่สามารถสรุปความรู้สำหรับโดเมนต่าง ๆ ได้อย่างมีประสิทธิภาพ และดำเนินงานได้พร้อมกันหลายพันรายการ PaLM เป็นการนำระบบนี้ไปใช้ในระดับขนาดใหญ่ครั้งแรก โดยการฝึกอบรมถูกแบ่งขนานบนโปรเซสเซอร์เฉพาะทาง TPU v4 จำนวน 6,144 ตัว ที่รวมกันเป็นสองคลัสเตอร์บนคลาวด์ (TPU v4 Pods)[1]

ในช่วงเวลาที่สร้างขึ้น นี่คือการกำหนดค่า TPU ที่ใหญ่ที่สุดที่เคยใช้สำหรับการฝึกอบรมโมเดลเดียว ระบบบรรลุประสิทธิภาพการใช้งานฮาร์ดแวร์ที่สูงเป็นประวัติการณ์ (57.8% FLOPs) ซึ่งทำให้สามารถแซงหน้าโครงการก่อนหน้าในด้านขนาด และสามารถฝึกอบรมโมเดลที่มีพารามิเตอร์มากกว่าครึ่งล้านล้านตัวได้สำเร็จ[3]

สถาปัตยกรรมและข้อมูลสำหรับการฝึกอบรม

สถาปัตยกรรมของโมเดล

PaLM คือ Language Model แบบ dense (ไม่กระจาย) ที่ใช้สถาปัตยกรรม «decoder-only» (decoder-only) ซึ่งคล้ายกับโมเดลในตระกูล GPT สถาปัตยกรรมนี้มุ่งเน้นที่งานการทำนาย token ถัดไปและเหมาะสำหรับการสร้างข้อความ ต่างจากสถาปัตยกรรม transformer มาตรฐาน PaLM ใช้การปรับแต่งสำคัญหลายอย่างเพื่อเพิ่มประสิทธิภาพ[1]:

  • เลเยอร์แบบขนาน: กลไก attention และเลเยอร์แบบเชื่อมต่อเต็มรูปแบบถูกคำนวณแบบขนาน ซึ่งช่วยเร่งการฝึกอบรมได้ประมาณ 15%
  • SwiGLU activation: การใช้ฟังก์ชัน activation แบบ SwiGLU แทน ReLU มาตรฐาน ซึ่งช่วยปรับปรุงคุณภาพของโมเดลได้อย่างมีนัยสำคัญ

ข้อมูลสำหรับการฝึกอบรม

PaLM ได้รับการฝึกอบรมบนคลังข้อมูลคุณภาพสูงที่มีขนาด 780 พันล้าน token ชุดข้อมูลนี้มีความหลากหลายและหลายภาษา ประกอบด้วย[1]:

  • เอกสารเว็บและหนังสือคุณภาพสูง
  • บทความจาก Wikipedia
  • บทสนทนาจากเครือข่ายสังคมออนไลน์ (50% ของคลังข้อมูล)
  • ซอร์สโค้ดจาก GitHub (5% ของคลังข้อมูล)

ประมาณ 78% ของข้อมูลเป็นภาษาอังกฤษ และอีก 22% ที่เหลือเป็นชุดข้อมูลหลายภาษา สำหรับการแบ่ง token ใช้เทคนิค «ไม่สูญเสียข้อมูล» แบบพิเศษที่รักษาช่องว่างทั้งหมด (สำคัญมากสำหรับโค้ด) และแบ่งสัญลักษณ์ Unicode ที่ไม่รู้จักออกเป็นไบต์

ความสามารถและผลลัพธ์

ความสามารถแบบ Emergent และ Few-Shot Learning

PaLM แสดงให้เห็นว่าการเพิ่มขนาดของโมเดล ปริมาณข้อมูล และกำลังการคำนวณ สามารถนำไปสู่ความสามารถแบบ emergent (ที่เกิดขึ้นอย่างไม่คาดคิด) ในหลายงาน ประสิทธิภาพของโมเดลเพิ่มขึ้นอย่างรวดเร็วและไม่เป็นเชิงเส้นเฉพาะเมื่อถึงระดับขนาดสูงสุดเท่านั้น ซึ่งบ่งชี้ถึงการเกิดขึ้นของความสามารถใหม่ที่ไม่เคยสังเกตพบมาก่อน[3]

โมเดลได้รับการประเมินในรูปแบบ few-shot learning (โดยไม่มีการ fine-tuning มีเพียงตัวอย่างเล็กน้อยใน prompt) และแซงหน้าโมเดลขนาดใหญ่ก่อนหน้าอย่าง GPT-3 และ LaMDA ใน 28 จาก 29 NLP benchmark ยอดนิยม บน benchmark ที่ซับซ้อนอย่าง BIG-bench PaLM กลายเป็นโมเดลแรกที่มีผลลัพธ์เกินกว่าระดับเฉลี่ยของผู้ทดสอบมนุษย์[1]

Chain-of-Thought Reasoning - การให้เหตุผลแบบลูกโซ่ความคิด

หนึ่งในความสำเร็จที่โดดเด่นที่สุดของ PaLM คือความสามารถในการให้เหตุผลเชิงตรรกะหลายขั้นตอน เมื่อใช้เทคนิค «chain-of-thought prompting»[1] เทคนิคนี้คือการให้ตัวอย่างแก่โมเดลที่แสดงการแก้ปัญหาเป็นขั้นตอน หลังจากเรียนรู้จากตัวอย่างเหล่านี้แล้ว PaLM สามารถสร้าง «ลูกโซ่ความคิด» ของตัวเองเพื่อแก้ปัญหาใหม่ที่ซับซ้อน เช่น:

  • โจทย์คณิตศาสตร์: ในการทดสอบ GSM8K (โจทย์ระดับประถมศึกษา) PaLM แก้ปัญหาได้ 58% ซึ่งแซงหน้าผลลัพธ์ state-of-the-art ก่อนหน้าที่ทำได้โดยโมเดลที่ผ่านการ fine-tuning
  • โจทย์สามัญสำนึก: โมเดลสามารถสร้างคำอธิบายที่ละเอียดสำหรับโจทย์ที่ไม่ตรงไปตรงมา เช่น การให้ความหมายของมุกตลกที่ไม่เคยพบมาก่อน

ความสามารถนี้ทำให้กระบวนการ «คิด» ของโมเดลโปร่งใสและคล้ายกับมนุษย์มากขึ้น

การสร้างโค้ดและความสามารถหลายภาษา

แม้ว่าซอร์สโค้ดจะมีเพียง 5% ของข้อมูลการฝึกอบรม PaLM แสดงระดับที่เทียบได้กับโมเดลเฉพาะทางอย่าง OpenAI Codex ในงานการสร้างและแปลงโค้ด โมเดลยังแสดงให้เห็นถึงความสามารถที่แข็งแกร่งในงานหลายภาษา รวมถึงการแปล[3]

วิวัฒนาการและผู้สืบทอด: ตระกูล PaLM

PaLM กลายเป็นรากฐานสำหรับกลุ่มโมเดลทั้งหมดที่ Google พัฒนา

PaLM 2

PaLM 2 ที่เปิดตัวในเดือนพฤษภาคม 2023 เป็นผู้สืบทอดที่มีประสิทธิภาพและรองรับหลายภาษามากขึ้น แทนที่จะมุ่งเน้นจำนวนพารามิเตอร์ ได้เปลี่ยนจุดเน้นไปที่คุณภาพของข้อมูลการฝึกอบรมและประสิทธิภาพของสถาปัตยกรรม PaLM 2 ได้รับการฝึกอบรมบนข้อความในมากกว่า 100 ภาษา และแสดงความสามารถที่ดีขึ้นในด้านตรรกะ การเขียนโปรแกรม และการแปล[4] โมเดลเปิดตัวในสี่ขนาด (จากเล็กที่สุดไปใหญ่ที่สุด): Gecko, Otter, Bison และ Unicorn ตัวแปรที่กะทัดรัดที่สุด (Gecko) เบาพอที่จะทำงานบนอุปกรณ์มือถือในโหมดออฟไลน์

เวอร์ชันเฉพาะทาง

บนพื้นฐานของ PaLM และ PaLM 2 ได้มีการสร้างเวอร์ชันสำหรับโดเมนเฉพาะ:

  • Med-PaLM 2: โมเดลเฉพาะทางสำหรับการแพทย์ กลายเป็นระบบ AI แรกที่บรรลุระดับผู้เชี่ยวชาญในคำถามของการสอบใบอนุญาตแพทย์ของสหรัฐอเมริกา (USMLE)[4]
  • Sec-PaLM 2: โมเดลที่มุ่งเน้นด้านความปลอดภัยทางไซเบอร์ ได้รับการฝึกอบรมเพื่อตรวจหาช่องโหว่และวิเคราะห์โค้ดที่เป็นอันตราย[5]

PaLM-E: เวอร์ชัน Multimodal

PaLM-E (Pathways Language Model Embodied) คือโมเดล multimodal ที่รวม Language Model PaLM เข้ากับข้อมูลภาพจาก Vision Transformer (ViT) ซึ่งช่วยให้โมเดลสามารถประมวลผลทั้งข้อความและรูปภาพ แก้ปัญหาที่เกี่ยวข้องกับโลกกายภาพ เช่น สำหรับการควบคุมหุ่นยนต์[6]

ด้านจริยธรรมและข้อจำกัด

ผู้สร้าง PaLM เน้นย้ำถึงความจำเป็นในการพัฒนา Large Language Model อย่างมีความรับผิดชอบ บทความวิทยาศาสตร์ทางการได้ทำการวิเคราะห์ความลำเอียงและความเป็นพิษที่อาจเกิดขึ้นในข้อความที่โมเดลสร้าง เพื่อความโปร่งใส Google ได้เผยแพร่แผนที่โมเดล (Model Card)และเอกสารข้อมูล (Datasheet)สำหรับ PaLM ซึ่งบันทึกลักษณะของ dataset ผลการทดสอบ และข้อจำกัดที่พบ[1] มาตรการเหล่านี้สอดคล้องกับแนวปฏิบัติ AI ที่มีความรับผิดชอบในปัจจุบัน และมุ่งลดความเสี่ยงที่เกี่ยวข้องกับอคติและการสร้างเนื้อหาที่เป็นอันตราย

ลิงก์

  • บล็อกทางการของ Google เกี่ยวกับ PaLM
  • PaLM API สำหรับนักพัฒนา

บรรณานุกรม

  • Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
  • Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
  • Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
  • Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
  • Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
  • Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
  • Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
  • Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
  • Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.

หมายเหตุ

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
  2. «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
  3. 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
  4. 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
  5. «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
  6. «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]