LLaMA (Meta AI) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

LLaMA (Large Language Model Meta AI) — กลุ่มโมเดลภาษาขนาดใหญ่ (LLM) ที่มีโค้ดเปิดเผยเป็นส่วนใหญ่ พัฒนาโดยหน่วยวิจัย Meta AI โมเดล LLaMA สร้างบนสถาปัตยกรรม transformer ที่ปรับปรุงแล้ว มุ่งเน้นประสิทธิภาพการคำนวณสูง การทำให้เทคโนโลยี AI ขั้นสูงเข้าถึงได้ง่ายขึ้น และการปรับแต่งสำหรับงานเฉพาะทาง กลุ่มโมเดลนี้พัฒนาจากการเปิดตัวเพื่อการวิจัยในชื่อ LLaMA 1 (กุมภาพันธ์ 2023) ไปจนถึงโมเดลมัลติโมดัล LLaMA 4 (วางแผนเปิดตัวในปี 2026)

ชื่อเรียก

ตัวย่อ LLaMA ย่อมาจาก Large Language Model Meta AI (โมเดลภาษาขนาดใหญ่ Meta AI)

  • Large Language Model — เน้นย้ำขนาดของโมเดลที่มีพารามิเตอร์นับตั้งแต่หลายพันล้านจนถึงหลายล้านล้าน
  • Meta AI — ระบุผู้พัฒนา ซึ่งได้แก่กลุ่มวิจัย Meta

ประวัติการพัฒนา

การพัฒนา LLaMA เริ่มต้นในช่วงปลายปี 2022 เป็นการตอบสนองเชิงกลยุทธ์ของ Meta ต่อความสำเร็จของ ChatGPT จาก OpenAI มาร์ก ซักเคอร์เบิร์กได้จัดตั้งทีมสหสาขาวิชาชีพซึ่งรวมถึงนักวิจัยจากห้องปฏิบัติการ FAIR (Facebook AI Research) ยาน เลอคุน หัวหน้า FAIR ซึ่งยึดหลักการเปิดเผยงานวิจัยทั้งหมดของห้องปฏิบัติการมาตั้งแต่ปี 2013 มีบทบาทสำคัญในปรัชญาของโครงการ

เวอร์ชันแรก LLaMA 1 เปิดตัวในเดือนกุมภาพันธ์ 2023 ภายใต้ใบอนุญาตสำหรับการวิจัย หลังจากเปิดตัวไม่นาน ในเดือนมีนาคม 2023 น้ำหนักของโมเดลได้รั่วไหลสู่อินเทอร์เน็ตผ่าน BitTorrent เหตุการณ์นี้แทนที่จะหยุดยั้งโครงการ กลับกระตุ้นการพัฒนาให้เร็วขึ้น เนื่องจากเปิดโอกาสให้นักวิจัยอิสระและผู้ที่สนใจทั่วโลกได้ทดลองใช้โมเดล ส่งผลให้มีโมเดลดัดแปลงหลายหมื่นรุ่นปรากฏบนแพลตฟอร์ม Hugging Face เวอร์ชันถัดมาตั้งแต่ LLaMA 2 เป็นต้นไป เปิดตัวภายใต้ใบอนุญาตเชิงพาณิชย์[1] ตอกย้ำสถานะของ LLaMA ในฐานะผู้เล่นหลักในตลาดโมเดล AI แบบเปิด

วิวัฒนาการของโมเดลและลำดับเวลาการเปิดตัว

ลำดับเวลาการพัฒนาโมเดล LLaMA
เวอร์ชัน วันที่เปิดตัว ช่วงพารามิเตอร์ นวัตกรรมและคุณสมบัติสำคัญ
LLaMA 1 กุมภาพันธ์ 2023 7B – 65B สถาปัตยกรรมพื้นฐาน (RMSNorm, SwiGLU, RoPE) ฝึกด้วย 1.4 ล้านล้าน token หน้าต่างบริบท 2048 token ใบอนุญาตสำหรับการวิจัย
LLaMA 2 กรกฎาคม 2023 7B – 70B fine-tuning สำหรับบทสนทนา (RLHF) นำ Grouped-Query Attention (GQA) มาใช้ หน้าต่างบริบท 4096 token ใบอนุญาตเชิงพาณิชย์ฉบับแรก
Code Llama สิงหาคม 2023 7B – 70B เวอร์ชันเฉพาะทางสำหรับโค้ด fine-tuning บน token โค้ด 500 พันล้าน มีตัวเลือก: พื้นฐาน เฉพาะทาง Python และ instruction-tuned
LLaMA 3 เมษายน 2024 8B, 70B ฝึกด้วย 15 ล้านล้าน token tokenizer ที่ปรับปรุงด้วยคลังคำศัพท์ 128,000 token ประสิทธิภาพสูง (82% บน MMLU)
LLaMA 3.1 กรกฎาคม 2024[2] 8B, 70B, 405B โมเดลเรือธง 405B ที่มีประสิทธิภาพระดับ GPT-4o หน้าต่างบริบทสูงสุด 128,000 token เพิ่มความสามารถในการประมวลผลภาพ
LLaMA 4 (แผน: เมษายน 2025) 109B (Scout), 400B (Maverick), 2T (Behemoth) สถาปัตยกรรม Mixture-of-Experts (MoE) มัลติโมดัลแบบเนทีฟ (ข้อความ ภาพ วิดีโอ) หน้าต่างบริบทสูงสุด 10 ล้าน token

สถาปัตยกรรม

LLaMA ใช้สถาปัตยกรรม transformer แบบ autoregressive decoder แต่นำการปรับปรุงสำคัญหลายประการมาใช้เพื่อเพิ่มประสิทธิภาพการคำนวณและคุณภาพของข้อความที่สร้างขึ้น:

  • Pre-normalization (การทำให้เป็นมาตรฐานก่อน) การทำให้เป็นมาตรฐานจะนำไปใช้ที่อินพุตของแต่ละชั้นย่อยของ transformer แทนที่จะเป็นเอาต์พุต วิธีนี้ทำให้การฝึกเครือข่ายที่ลึกมากมีเสถียรภาพและป้องกันปัญหาเกี่ยวกับ gradient
  • RMSNorm (Root Mean Square Layer Normalization) ใช้ RMSNorm แทน LayerNorm มาตรฐาน เทคนิคการทำให้เป็นมาตรฐานนี้ตัดการดำเนินการลบค่าเฉลี่ยออก ทำให้การคำนวณเร็วขึ้น 10–50% ในขณะที่ยังคงความเสถียร
  • SwiGLU (Swish-Gated Linear Unit) ใช้ SwiGLU เป็นฟังก์ชันการกระตุ้นแทน ReLU หรือ GELU กลไก gating นี้สร้างการไหลของ gradient ที่ราบรื่นขึ้นและปรับปรุงคุณภาพของโมเดล
  • RoPE (Rotary Position Embeddings, embedding ตำแหน่งแบบหมุน) ใช้ embedding ตำแหน่งสัมพันธ์ RoPE สำหรับการเข้ารหัสตำแหน่งของ token ซึ่งช่วยให้โมเดลสามารถ extrapolate ไปยังลำดับที่ยาวกว่าที่ใช้ในระหว่างการฝึกได้ดีขึ้น
  • GQA (Grouped-Query Attention) นำมาใช้ใน LLaMA 2 เทคนิคนี้เป็นการปรับปรุง multi-head attention ที่ลดความต้องการหน่วยความจำอย่างมีนัยสำคัญและเพิ่มความเร็วในการสร้างข้อความ
  • Mixture-of-Experts (MoE) (วางแผนใน LLaMA 4) สถาปัตยกรรมที่แบ่งพารามิเตอร์ของโมเดลออกเป็นเครือข่ายย่อย "ผู้เชี่ยวชาญ" โดยเปิดใช้งานเพียงส่วนน้อยสำหรับแต่ละคำขอ ซึ่งลดต้นทุนการคำนวณในการ inference อย่างมาก

การกำหนดค่า LLaMA 1

พารามิเตอร์สถาปัตยกรรมของโมเดล LLaMA 1
โมเดล พารามิเตอร์ มิติของสถานะแฝง จำนวนชั้น จำนวน attention head ปริมาณข้อมูลฝึก
7B 6.7B 4096 32 32 1.0T token
13B 13.0B 5120 40 40 1.0T token
33B 32.5B 6656 60 52 1.4T token
65B 65.2B 8192 80 64 1.4T token

ข้อมูลฝึก

ปริมาณชุดข้อมูลฝึกเพิ่มขึ้นจาก 1.4 ล้านล้าน token สำหรับ LLaMA 1 เป็น 15 ล้านล้าน token สำหรับ LLaMA 3 การฝึกใช้แหล่งข้อมูลสาธารณะ ได้แก่ Common Crawl (คิดเป็นสัดส่วนสูงสุด 67% ของข้อมูล), C4, GitHub, Wikipedia, Books, ArXiv และ Stack Exchange สำหรับ LLaMA 3 ยังใช้ข้อมูลส่วนตัวคุณภาพสูงด้วย

ประสิทธิภาพและการเปรียบเทียบ

  • บน benchmark: โมเดล LLaMA 3.1 (405B) แสดงผลลัพธ์ใกล้เคียงกับ GPT-4o โดยบน MMLU ทำได้ 88.6% ซึ่งน้อยกว่า GPT-4o เพียง 0.1 เปอร์เซ็นต์ สำหรับงานสร้างโค้ด HumanEval LLaMA 3.1 ทำได้ 89% (GPT-4o — 90.2%)
  • ประสิทธิภาพเชิงพารามิเตอร์: โมเดล LLaMA ที่มีพารามิเตอร์น้อยกว่ามักแสดงผลดีกว่าโมเดลขนาดใหญ่กว่าของคู่แข่ง ตัวอย่างเช่น LLaMA 1 (13B) มีประสิทธิภาพเหนือกว่า GPT-3 (175B) ในการทดสอบส่วนใหญ่
  • ต้นทุน: เมื่อโฮสต์ในเครื่องเอง ต้นทุนการ inference ของ LLaMA อาจต่ำกว่าการใช้ API แบบกรรมสิทธิ์ได้ถึง 50 เท่า ทำให้เทคโนโลยีนี้เข้าถึงได้สำหรับธุรกิจขนาดเล็กและกลาง

การอนุญาตสิทธิ์

  • LLaMA 1 เผยแพร่ภายใต้ใบอนุญาตการวิจัยแบบไม่ใช้เชิงพาณิชย์พร้อมการเข้าถึงตามคำขอ
  • LLaMA 2 และเวอร์ชันใหม่กว่า เผยแพร่ภายใต้ Llama Community License ซึ่งอนุญาตให้ใช้เชิงพาณิชย์และการดัดแปลงได้ อย่างไรก็ตาม ใบอนุญาตมีข้อจำกัด: บริษัทที่มีผู้ใช้งานมากกว่า 700 ล้านคนต่อเดือนต้องขอรับอนุญาตพิเศษจาก Meta ซึ่งก่อให้เกิดการถกเถียงว่า LLaMA เป็นโมเดลเปิดอย่างสมบูรณ์หรือไม่

การประยุกต์ใช้

โมเดล LLaMA ถูกนำไปรวมในผลิตภัณฑ์ของบริษัทหลายพันแห่งและใช้ในด้านต่างๆ:

  • ภาคธุรกิจ: Zoom ใช้ LLaMA ใน AI Companion สำหรับสรุปการประชุม Shopify ใช้สำหรับประมวลผล 40–60 ล้านคำขอต่อวันเพื่อเสริมคุณสมบัติข้อมูลเมตาของสินค้า Instacart ใช้ในผู้ช่วยภายในชื่อ Ava
  • วิทยาศาสตร์และสังคม: Meditron (การปรับแต่ง LLaMA) ใช้สำหรับการวินิจฉัยทางการแพทย์ในพื้นที่ที่มีทรัพยากรจำกัด
  • ภาครัฐและอุตสาหกรรม: Meta ได้ทำความร่วมมือกับ Lockheed Martin และ Palantir NASA ใช้ LLaMA 3 บนสถานีอวกาศนานาชาติ (ISS) เป็นผู้ช่วยแบบออฟไลน์สำหรับปฏิบัติการสำคัญที่ไม่มีการเชื่อมต่อกับโลก

ข้อจำกัดและการวิจารณ์

  • อคติและความปลอดภัย: การตรวจสอบอิสระแสดงให้เห็นว่าโมเดล LLaMA แม้จะมีมาตรการความปลอดภัย อาจยังคงแสดงอคติที่เป็นอันตราย การรั่วไหลของน้ำหนัก LLaMA 1 ทำให้คำถามเกี่ยวกับการใช้เทคโนโลยีในทางที่เป็นอันตรายเด่นชัดขึ้น
  • ช่องว่างด้านความรู้: ในสาขาเฉพาะทางที่แคบมาก LLaMA อาจแสดงช่องว่างด้านความรู้ ตัวอย่างเช่น ความแม่นยำบนแบบทดสอบทางการแพทย์ nephSAP อยู่ที่ 17–30% เทียบกับ 73% ของ GPT-4
  • การใช้พลังงาน: การฝึกโมเดลขนาดใหญ่ต้องการทรัพยากรมหาศาล การฝึก LLaMA 1 ต้องการพลังงาน 2,638 MWh ซึ่งเทียบเท่ากับการปล่อย CO₂ จำนวน 1,015 ตัน

อนาคต

Meta วางแผนลงทุนสูงสุด 65 พันล้านดอลลาร์ในโครงสร้างพื้นฐาน AI ภายในปี 2025 ขณะนี้อยู่ในระหว่างการพัฒนา LLaMA 4 Behemoth ที่มี 2 ล้านล้านพารามิเตอร์ ซึ่งจะรองรับภาษามากกว่า 200 ภาษาและได้รับการผสานรวมอย่างลึกซึ้งกับผลิตภัณฑ์ metaverse

เอกสารอ้างอิง

  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  • Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
  • Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
  • Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
  • Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
  • Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.

หมายเหตุ

  1. Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
  2. LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.

ดูเพิ่มเติม

  • GPT
  • โมเดลภาษาขนาดใหญ่
  • Transformer (สถาปัตยกรรมของโครงข่ายประสาทเทียม)