Jamba (language model) (TH)
Jamba — คือตระกูลโมเดลภาษาขนาดใหญ่ (LLM) ที่พัฒนาโดยบริษัทวิจัย AI ของอิสราเอล AI21 Labs Jamba ถือเป็น สถาปัตยกรรมแบบไฮบริด แรกในประเภทนี้ ซึ่งรวมองค์ประกอบสำคัญของสองแนวทางหลักในการพัฒนา AI เข้าด้วยกัน ได้แก่ transformer และโมเดลปริภูมิสถานะ (State Space Models, SSM) โดยเฉพาะอย่างยิ่งสถาปัตยกรรม Mamba[1]
เป้าหมายหลักของ Jamba คือการแก้ปัญหาการแลกเปลี่ยนพื้นฐานของ LLM ยุคใหม่ ได้แก่ คุณภาพและประสิทธิภาพสูง (ลักษณะเด่นของ transformer) เทียบกับประสิทธิภาพและความสามารถในการประมวลผล context ที่ยาวมาก (ลักษณะเด่นของ SSM) ด้วยการรวมแนวทางเหล่านี้เข้าด้วยกันและเพิ่มความเบาบางด้วย Mixture-of-Experts (MoE) Jamba จึงนำเสนอโมเดลที่มีพลังสูง มีประสิทธิภาพ และสามารถทำงานกับข้อความปริมาณมหาศาลในคำขอเดียว
สถาปัตยกรรมของ Jamba อย่างละเอียด
Jamba ไม่ได้เพียงแค่สลับชั้น transformer และ Mamba เท่านั้น แต่ใช้ โครงสร้างแบบบล็อก ที่ออกแบบมาอย่างพิถีพิถัน โดยแต่ละบล็อกประกอบด้วยแปดชั้น
โครงสร้างของบล็อก Jamba หนึ่งบล็อก:
- ชั้น Transformer หนึ่งชั้น: ชั้นนี้รับผิดชอบความเข้าใจ "เชิงลึก" และการอนุมานที่ซับซ้อน โดยมีสถาปัตยกรรม Mixture-of-Experts (MoE) ฝังอยู่ภายใน
- ชั้น Mamba เจ็ดชั้น: ชั้นเหล่านี้ตามหลังชั้น transformer และรับผิดชอบการประมวลผลลำดับอย่างมีประสิทธิภาพและการ "ส่งผ่าน" ข้อมูลผ่าน context ที่ยาว[2]
โครงสร้างแบบอสมมาตรนี้ช่วยให้โมเดลจัดการทรัพยากรการคำนวณได้อย่างมีประสิทธิภาพ กล่าวคือ การดำเนินการ transformer ที่หนักแต่ทรงพลังจะดำเนินการน้อยครั้งกว่า ในขณะที่การดำเนินการ Mamba ที่เบาและรวดเร็วจะดำเนินการบ่อยกว่า
Mixture-of-Experts (MoE) - การผสานรวม
Jamba ใช้สถาปัตยกรรม MoE เพื่อเพิ่มประสิทธิภาพยิ่งขึ้นไปอีก
- MoE ถูกนำมาใช้ เฉพาะกับบล็อกเชื่อมต่อเต็มรูปแบบ (FFN) ภายในชั้น transformer เท่านั้น[3] ชั้น Mamba ยังคงเป็นแบบหนาแน่น
- ในโมเดล Jamba รุ่นแรกมี 16 ผู้เชี่ยวชาญ
- สำหรับแต่ละ token เครือข่ายตัวกำหนดเส้นทางจะเลือก 2 ผู้เชี่ยวชาญที่ดีที่สุด (Top-2 gating)
นั่นหมายความว่าแม้จำนวนพารามิเตอร์รวมของโมเดลจะมาก (52 พันล้าน) แต่ในแต่ละขั้นตอนการประมวลผล token ในชั้น transformer จะมีเพียง 2 จาก 16 ผู้เชี่ยวชาญที่ทำงานอยู่ ทำให้การคำนวณรวดเร็วมาก
วิวัฒนาการของโมเดล Jamba
Jamba-v0.1 (มีนาคม 2024)
โมเดลแรกที่นำเสนอในตระกูลนี้มีลักษณะดังต่อไปนี้:
| ลักษณะ | ค่า |
|---|---|
| จำนวนพารามิเตอร์ทั้งหมด | 52 พันล้าน |
| พารามิเตอร์ที่ใช้งานอยู่ | ~12 พันล้าน |
| จำนวนผู้เชี่ยวชาญ (MoE) | 16 (2 ที่ใช้งานอยู่) |
| หน้าต่าง context | 256,000 token |
| ลิขสิทธิ์ | Apache 2.0[4] |
ด้วยสถาปัตยกรรมแบบไฮบริด Jamba-1 สามารถประมวลผล context ที่มีความยาว 256,000 token ซึ่งเทียบเท่ากับนิยายประมาณ 400 หน้า และสามารถติดตั้งบน GPU สำหรับผู้บริโภคเพียงตัวเดียวที่มีหน่วยความจำ 80 GB[5]
Jamba-1.5 (2024)
ในปี 2024 AI21 Labs ได้เปิดตัวตระกูลโมเดล Jamba 1.5 ที่อัปเดตแล้ว ซึ่งประกอบด้วยสองเวอร์ชัน ได้แก่ Jamba 1.5 Mini (พารามิเตอร์ที่ใช้งาน 12B จากทั้งหมด 52B) และ Jamba 1.5 Large (พารามิเตอร์ที่ใช้งาน 94B จากทั้งหมด 398B)[6] โมเดลเหล่านี้แสดงให้เห็นถึงการปรับปรุงประสิทธิภาพที่มีนัยสำคัญ:
- การอนุมานบน context ยาวเร็วขึ้นถึง 2.5 เท่าเมื่อเทียบกับคู่แข่ง
- รองรับเก้าภาษา รวมถึงภาษาอังกฤษ สเปน ฝรั่งเศส และอาหรับ[7]
ข้อได้เปรียบหลักและประสิทธิภาพ
- หน้าต่าง context ขนาดใหญ่มาก: 256,000 token — เป็นหนึ่งในหน้าต่างที่ใหญ่ที่สุดในบรรดาโมเดลที่มีอยู่ทั้งหมด (รวมถึงโมเดลที่เป็นกรรมสิทธิ์) ณ เวลาที่เปิดตัว ทำให้ Jamba เหมาะสำหรับงานที่ต้องการวิเคราะห์เอกสารขนาดใหญ่ เช่น สัญญาทางกฎหมาย งานวิจัยทางวิทยาศาสตร์ codebase ทั้งหมด หรือบทสนทนายาว
- ประสิทธิภาพและความมีประสิทธิผลสูง: ในการทดสอบ Jamba แสดงประสิทธิภาพที่เทียบเคียงหรือเหนือกว่าโมเดลเปิดชั้นนำในขนาดเดียวกัน เช่น Llama และ Mixtral พร้อมทั้งแสดง ปริมาณงานที่สูงกว่า 3 เท่า บน context ยาว[8]
- ความเปิดกว้างและการเข้าถึง: Jamba เผยแพร่ภายใต้ลิขสิทธิ์ Apache 2.0 ที่อนุญาตอย่างกว้างขวาง ซึ่งเปิดให้ใช้งานอย่างเสรีเพื่อวัตถุประสงค์ทางการค้าและการวิจัย น้ำหนักของโมเดลมีให้บนแพลตฟอร์ม Hugging Face
ผลลัพธ์บน benchmark
Jamba 1.5 แสดงผลลัพธ์ที่แข่งขันได้บน benchmark ต่างๆ[9]:
- Jamba 1.5 Mini ได้คะแนน 46.1 ใน Arena Hard ทำให้เป็นโมเดลสาธารณะชั้นนำในหมวดหมู่นี้[10]
- Jamba 1.5 Large ได้คะแนน 65.4 ใน Arena Hard เหนือกว่า Llama 3.1 70B และ 405B
การประยุกต์ใช้และการเข้าถึง
Jamba ได้รับการปรับให้เหมาะสมสำหรับการใช้งานทางธุรกิจและรองรับความสามารถต่างๆ เช่น การเรียกใช้ฟังก์ชัน การแสดงผลแบบมีโครงสร้างใน JSON และการประมวลผลเอกสาร โมเดลนี้มีให้บนแพลตฟอร์มหลายแห่ง รวมถึง:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
เพื่อรองรับการอนุมานที่คุ้มต้นทุน AI21 Labs ได้เปิดตัว ExpertsInt8 — เทคนิค quantization ใหม่ที่ช่วยให้สามารถติดตั้ง Jamba 1.5 Large บนเครื่องที่มี GPU 8 ตัว ขนาด 80GB โดยไม่สูญเสียคุณภาพในการประมวลผล context ขนาด 256K token[11]
เอกสารอ้างอิง
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
หมายเหตุ
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]