LLaMA (Meta AI) (TH)
LLaMA (Large Language Model Meta AI) — กลุ่มโมเดลภาษาขนาดใหญ่ (LLM) ที่มีโค้ดเปิดเผยเป็นส่วนใหญ่ พัฒนาโดยหน่วยวิจัย Meta AI โมเดล LLaMA สร้างบนสถาปัตยกรรม transformer ที่ปรับปรุงแล้ว มุ่งเน้นประสิทธิภาพการคำนวณสูง การทำให้เทคโนโลยี AI ขั้นสูงเข้าถึงได้ง่ายขึ้น และการปรับแต่งสำหรับงานเฉพาะทาง กลุ่มโมเดลนี้พัฒนาจากการเปิดตัวเพื่อการวิจัยในชื่อ LLaMA 1 (กุมภาพันธ์ 2023) ไปจนถึงโมเดลมัลติโมดัล LLaMA 4 (วางแผนเปิดตัวในปี 2026)
ชื่อเรียก
ตัวย่อ LLaMA ย่อมาจาก Large Language Model Meta AI (โมเดลภาษาขนาดใหญ่ Meta AI)
- Large Language Model — เน้นย้ำขนาดของโมเดลที่มีพารามิเตอร์นับตั้งแต่หลายพันล้านจนถึงหลายล้านล้าน
- Meta AI — ระบุผู้พัฒนา ซึ่งได้แก่กลุ่มวิจัย Meta
ประวัติการพัฒนา
การพัฒนา LLaMA เริ่มต้นในช่วงปลายปี 2022 เป็นการตอบสนองเชิงกลยุทธ์ของ Meta ต่อความสำเร็จของ ChatGPT จาก OpenAI มาร์ก ซักเคอร์เบิร์กได้จัดตั้งทีมสหสาขาวิชาชีพซึ่งรวมถึงนักวิจัยจากห้องปฏิบัติการ FAIR (Facebook AI Research) ยาน เลอคุน หัวหน้า FAIR ซึ่งยึดหลักการเปิดเผยงานวิจัยทั้งหมดของห้องปฏิบัติการมาตั้งแต่ปี 2013 มีบทบาทสำคัญในปรัชญาของโครงการ
เวอร์ชันแรก LLaMA 1 เปิดตัวในเดือนกุมภาพันธ์ 2023 ภายใต้ใบอนุญาตสำหรับการวิจัย หลังจากเปิดตัวไม่นาน ในเดือนมีนาคม 2023 น้ำหนักของโมเดลได้รั่วไหลสู่อินเทอร์เน็ตผ่าน BitTorrent เหตุการณ์นี้แทนที่จะหยุดยั้งโครงการ กลับกระตุ้นการพัฒนาให้เร็วขึ้น เนื่องจากเปิดโอกาสให้นักวิจัยอิสระและผู้ที่สนใจทั่วโลกได้ทดลองใช้โมเดล ส่งผลให้มีโมเดลดัดแปลงหลายหมื่นรุ่นปรากฏบนแพลตฟอร์ม Hugging Face เวอร์ชันถัดมาตั้งแต่ LLaMA 2 เป็นต้นไป เปิดตัวภายใต้ใบอนุญาตเชิงพาณิชย์[1] ตอกย้ำสถานะของ LLaMA ในฐานะผู้เล่นหลักในตลาดโมเดล AI แบบเปิด
วิวัฒนาการของโมเดลและลำดับเวลาการเปิดตัว
| เวอร์ชัน | วันที่เปิดตัว | ช่วงพารามิเตอร์ | นวัตกรรมและคุณสมบัติสำคัญ |
|---|---|---|---|
| LLaMA 1 | กุมภาพันธ์ 2023 | 7B – 65B | สถาปัตยกรรมพื้นฐาน (RMSNorm, SwiGLU, RoPE) ฝึกด้วย 1.4 ล้านล้าน token หน้าต่างบริบท 2048 token ใบอนุญาตสำหรับการวิจัย |
| LLaMA 2 | กรกฎาคม 2023 | 7B – 70B | fine-tuning สำหรับบทสนทนา (RLHF) นำ Grouped-Query Attention (GQA) มาใช้ หน้าต่างบริบท 4096 token ใบอนุญาตเชิงพาณิชย์ฉบับแรก |
| Code Llama | สิงหาคม 2023 | 7B – 70B | เวอร์ชันเฉพาะทางสำหรับโค้ด fine-tuning บน token โค้ด 500 พันล้าน มีตัวเลือก: พื้นฐาน เฉพาะทาง Python และ instruction-tuned |
| LLaMA 3 | เมษายน 2024 | 8B, 70B | ฝึกด้วย 15 ล้านล้าน token tokenizer ที่ปรับปรุงด้วยคลังคำศัพท์ 128,000 token ประสิทธิภาพสูง (82% บน MMLU) |
| LLaMA 3.1 | กรกฎาคม 2024[2] | 8B, 70B, 405B | โมเดลเรือธง 405B ที่มีประสิทธิภาพระดับ GPT-4o หน้าต่างบริบทสูงสุด 128,000 token เพิ่มความสามารถในการประมวลผลภาพ |
| LLaMA 4 | (แผน: เมษายน 2025) | 109B (Scout), 400B (Maverick), 2T (Behemoth) | สถาปัตยกรรม Mixture-of-Experts (MoE) มัลติโมดัลแบบเนทีฟ (ข้อความ ภาพ วิดีโอ) หน้าต่างบริบทสูงสุด 10 ล้าน token |
สถาปัตยกรรม
LLaMA ใช้สถาปัตยกรรม transformer แบบ autoregressive decoder แต่นำการปรับปรุงสำคัญหลายประการมาใช้เพื่อเพิ่มประสิทธิภาพการคำนวณและคุณภาพของข้อความที่สร้างขึ้น:
- Pre-normalization (การทำให้เป็นมาตรฐานก่อน) การทำให้เป็นมาตรฐานจะนำไปใช้ที่อินพุตของแต่ละชั้นย่อยของ transformer แทนที่จะเป็นเอาต์พุต วิธีนี้ทำให้การฝึกเครือข่ายที่ลึกมากมีเสถียรภาพและป้องกันปัญหาเกี่ยวกับ gradient
- RMSNorm (Root Mean Square Layer Normalization) ใช้ RMSNorm แทน LayerNorm มาตรฐาน เทคนิคการทำให้เป็นมาตรฐานนี้ตัดการดำเนินการลบค่าเฉลี่ยออก ทำให้การคำนวณเร็วขึ้น 10–50% ในขณะที่ยังคงความเสถียร
- SwiGLU (Swish-Gated Linear Unit) ใช้ SwiGLU เป็นฟังก์ชันการกระตุ้นแทน ReLU หรือ GELU กลไก gating นี้สร้างการไหลของ gradient ที่ราบรื่นขึ้นและปรับปรุงคุณภาพของโมเดล
- RoPE (Rotary Position Embeddings, embedding ตำแหน่งแบบหมุน) ใช้ embedding ตำแหน่งสัมพันธ์ RoPE สำหรับการเข้ารหัสตำแหน่งของ token ซึ่งช่วยให้โมเดลสามารถ extrapolate ไปยังลำดับที่ยาวกว่าที่ใช้ในระหว่างการฝึกได้ดีขึ้น
- GQA (Grouped-Query Attention) นำมาใช้ใน LLaMA 2 เทคนิคนี้เป็นการปรับปรุง multi-head attention ที่ลดความต้องการหน่วยความจำอย่างมีนัยสำคัญและเพิ่มความเร็วในการสร้างข้อความ
- Mixture-of-Experts (MoE) (วางแผนใน LLaMA 4) สถาปัตยกรรมที่แบ่งพารามิเตอร์ของโมเดลออกเป็นเครือข่ายย่อย "ผู้เชี่ยวชาญ" โดยเปิดใช้งานเพียงส่วนน้อยสำหรับแต่ละคำขอ ซึ่งลดต้นทุนการคำนวณในการ inference อย่างมาก
การกำหนดค่า LLaMA 1
| โมเดล | พารามิเตอร์ | มิติของสถานะแฝง | จำนวนชั้น | จำนวน attention head | ปริมาณข้อมูลฝึก |
|---|---|---|---|---|---|
| 7B | 6.7B | 4096 | 32 | 32 | 1.0T token |
| 13B | 13.0B | 5120 | 40 | 40 | 1.0T token |
| 33B | 32.5B | 6656 | 60 | 52 | 1.4T token |
| 65B | 65.2B | 8192 | 80 | 64 | 1.4T token |
ข้อมูลฝึก
ปริมาณชุดข้อมูลฝึกเพิ่มขึ้นจาก 1.4 ล้านล้าน token สำหรับ LLaMA 1 เป็น 15 ล้านล้าน token สำหรับ LLaMA 3 การฝึกใช้แหล่งข้อมูลสาธารณะ ได้แก่ Common Crawl (คิดเป็นสัดส่วนสูงสุด 67% ของข้อมูล), C4, GitHub, Wikipedia, Books, ArXiv และ Stack Exchange สำหรับ LLaMA 3 ยังใช้ข้อมูลส่วนตัวคุณภาพสูงด้วย
ประสิทธิภาพและการเปรียบเทียบ
- บน benchmark: โมเดล LLaMA 3.1 (405B) แสดงผลลัพธ์ใกล้เคียงกับ GPT-4o โดยบน MMLU ทำได้ 88.6% ซึ่งน้อยกว่า GPT-4o เพียง 0.1 เปอร์เซ็นต์ สำหรับงานสร้างโค้ด HumanEval LLaMA 3.1 ทำได้ 89% (GPT-4o — 90.2%)
- ประสิทธิภาพเชิงพารามิเตอร์: โมเดล LLaMA ที่มีพารามิเตอร์น้อยกว่ามักแสดงผลดีกว่าโมเดลขนาดใหญ่กว่าของคู่แข่ง ตัวอย่างเช่น LLaMA 1 (13B) มีประสิทธิภาพเหนือกว่า GPT-3 (175B) ในการทดสอบส่วนใหญ่
- ต้นทุน: เมื่อโฮสต์ในเครื่องเอง ต้นทุนการ inference ของ LLaMA อาจต่ำกว่าการใช้ API แบบกรรมสิทธิ์ได้ถึง 50 เท่า ทำให้เทคโนโลยีนี้เข้าถึงได้สำหรับธุรกิจขนาดเล็กและกลาง
การอนุญาตสิทธิ์
- LLaMA 1 เผยแพร่ภายใต้ใบอนุญาตการวิจัยแบบไม่ใช้เชิงพาณิชย์พร้อมการเข้าถึงตามคำขอ
- LLaMA 2 และเวอร์ชันใหม่กว่า เผยแพร่ภายใต้ Llama Community License ซึ่งอนุญาตให้ใช้เชิงพาณิชย์และการดัดแปลงได้ อย่างไรก็ตาม ใบอนุญาตมีข้อจำกัด: บริษัทที่มีผู้ใช้งานมากกว่า 700 ล้านคนต่อเดือนต้องขอรับอนุญาตพิเศษจาก Meta ซึ่งก่อให้เกิดการถกเถียงว่า LLaMA เป็นโมเดลเปิดอย่างสมบูรณ์หรือไม่
การประยุกต์ใช้
โมเดล LLaMA ถูกนำไปรวมในผลิตภัณฑ์ของบริษัทหลายพันแห่งและใช้ในด้านต่างๆ:
- ภาคธุรกิจ: Zoom ใช้ LLaMA ใน AI Companion สำหรับสรุปการประชุม Shopify ใช้สำหรับประมวลผล 40–60 ล้านคำขอต่อวันเพื่อเสริมคุณสมบัติข้อมูลเมตาของสินค้า Instacart ใช้ในผู้ช่วยภายในชื่อ Ava
- วิทยาศาสตร์และสังคม: Meditron (การปรับแต่ง LLaMA) ใช้สำหรับการวินิจฉัยทางการแพทย์ในพื้นที่ที่มีทรัพยากรจำกัด
- ภาครัฐและอุตสาหกรรม: Meta ได้ทำความร่วมมือกับ Lockheed Martin และ Palantir NASA ใช้ LLaMA 3 บนสถานีอวกาศนานาชาติ (ISS) เป็นผู้ช่วยแบบออฟไลน์สำหรับปฏิบัติการสำคัญที่ไม่มีการเชื่อมต่อกับโลก
ข้อจำกัดและการวิจารณ์
- อคติและความปลอดภัย: การตรวจสอบอิสระแสดงให้เห็นว่าโมเดล LLaMA แม้จะมีมาตรการความปลอดภัย อาจยังคงแสดงอคติที่เป็นอันตราย การรั่วไหลของน้ำหนัก LLaMA 1 ทำให้คำถามเกี่ยวกับการใช้เทคโนโลยีในทางที่เป็นอันตรายเด่นชัดขึ้น
- ช่องว่างด้านความรู้: ในสาขาเฉพาะทางที่แคบมาก LLaMA อาจแสดงช่องว่างด้านความรู้ ตัวอย่างเช่น ความแม่นยำบนแบบทดสอบทางการแพทย์ nephSAP อยู่ที่ 17–30% เทียบกับ 73% ของ GPT-4
- การใช้พลังงาน: การฝึกโมเดลขนาดใหญ่ต้องการทรัพยากรมหาศาล การฝึก LLaMA 1 ต้องการพลังงาน 2,638 MWh ซึ่งเทียบเท่ากับการปล่อย CO₂ จำนวน 1,015 ตัน
อนาคต
Meta วางแผนลงทุนสูงสุด 65 พันล้านดอลลาร์ในโครงสร้างพื้นฐาน AI ภายในปี 2025 ขณะนี้อยู่ในระหว่างการพัฒนา LLaMA 4 Behemoth ที่มี 2 ล้านล้านพารามิเตอร์ ซึ่งจะรองรับภาษามากกว่า 200 ภาษาและได้รับการผสานรวมอย่างลึกซึ้งกับผลิตภัณฑ์ metaverse
เอกสารอ้างอิง
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Grattafiori, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
- Jiang, Z. et al. (2023). Pre‑RMSNorm and Pre‑CRMSNorm Transformers: Equivalent and Efficient Pre‑LN Transformers. arXiv:2305.14858.
- Rozière, B. et al. (2023). Code Llama: Open Foundation Models for Code. arXiv:2308.12950.
- Shazeer, N. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Touvron, H. et al. (2023). LLaMA: Open and Efficient Foundation Language Models. arXiv:2302.13971.
- Touvron, H. et al. (2023). Llama 2: Open Foundation and Fine‑Tuned Chat Models. arXiv:2307.09288.
- Zhang, B.; Sennrich, R. (2019). Root Mean Square Layer Normalization. arXiv:1910.07467.
หมายเหตุ
- ↑ Лицензия LLaMA не соответствует всем критериям открытого ПО, так как накладывает ограничения на коммерческое использование крупнейшими компаниями и требует раскрытия информации о модификациях.
- ↑ LLaMA 3.1 была анонсирована и выпущена в июле 2024 года. См. официальный анонс Meta.
ดูเพิ่มเติม
- GPT
- โมเดลภาษาขนาดใหญ่
- Transformer (สถาปัตยกรรมของโครงข่ายประสาทเทียม)