Jamba (language model) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — คือตระกูลโมเดลภาษาขนาดใหญ่ (LLM) ที่พัฒนาโดยบริษัทวิจัย AI ของอิสราเอล AI21 Labs Jamba ถือเป็น สถาปัตยกรรมแบบไฮบริด แรกในประเภทนี้ ซึ่งรวมองค์ประกอบสำคัญของสองแนวทางหลักในการพัฒนา AI เข้าด้วยกัน ได้แก่ transformer และโมเดลปริภูมิสถานะ (State Space Models, SSM) โดยเฉพาะอย่างยิ่งสถาปัตยกรรม Mamba[1]

เป้าหมายหลักของ Jamba คือการแก้ปัญหาการแลกเปลี่ยนพื้นฐานของ LLM ยุคใหม่ ได้แก่ คุณภาพและประสิทธิภาพสูง (ลักษณะเด่นของ transformer) เทียบกับประสิทธิภาพและความสามารถในการประมวลผล context ที่ยาวมาก (ลักษณะเด่นของ SSM) ด้วยการรวมแนวทางเหล่านี้เข้าด้วยกันและเพิ่มความเบาบางด้วย Mixture-of-Experts (MoE) Jamba จึงนำเสนอโมเดลที่มีพลังสูง มีประสิทธิภาพ และสามารถทำงานกับข้อความปริมาณมหาศาลในคำขอเดียว

สถาปัตยกรรมของ Jamba อย่างละเอียด

Jamba ไม่ได้เพียงแค่สลับชั้น transformer และ Mamba เท่านั้น แต่ใช้ โครงสร้างแบบบล็อก ที่ออกแบบมาอย่างพิถีพิถัน โดยแต่ละบล็อกประกอบด้วยแปดชั้น

โครงสร้างของบล็อก Jamba หนึ่งบล็อก:

  • ชั้น Transformer หนึ่งชั้น: ชั้นนี้รับผิดชอบความเข้าใจ "เชิงลึก" และการอนุมานที่ซับซ้อน โดยมีสถาปัตยกรรม Mixture-of-Experts (MoE) ฝังอยู่ภายใน
  • ชั้น Mamba เจ็ดชั้น: ชั้นเหล่านี้ตามหลังชั้น transformer และรับผิดชอบการประมวลผลลำดับอย่างมีประสิทธิภาพและการ "ส่งผ่าน" ข้อมูลผ่าน context ที่ยาว[2]

โครงสร้างแบบอสมมาตรนี้ช่วยให้โมเดลจัดการทรัพยากรการคำนวณได้อย่างมีประสิทธิภาพ กล่าวคือ การดำเนินการ transformer ที่หนักแต่ทรงพลังจะดำเนินการน้อยครั้งกว่า ในขณะที่การดำเนินการ Mamba ที่เบาและรวดเร็วจะดำเนินการบ่อยกว่า

Mixture-of-Experts (MoE) - การผสานรวม

Jamba ใช้สถาปัตยกรรม MoE เพื่อเพิ่มประสิทธิภาพยิ่งขึ้นไปอีก

  • MoE ถูกนำมาใช้ เฉพาะกับบล็อกเชื่อมต่อเต็มรูปแบบ (FFN) ภายในชั้น transformer เท่านั้น[3] ชั้น Mamba ยังคงเป็นแบบหนาแน่น
  • ในโมเดล Jamba รุ่นแรกมี 16 ผู้เชี่ยวชาญ
  • สำหรับแต่ละ token เครือข่ายตัวกำหนดเส้นทางจะเลือก 2 ผู้เชี่ยวชาญที่ดีที่สุด (Top-2 gating)

นั่นหมายความว่าแม้จำนวนพารามิเตอร์รวมของโมเดลจะมาก (52 พันล้าน) แต่ในแต่ละขั้นตอนการประมวลผล token ในชั้น transformer จะมีเพียง 2 จาก 16 ผู้เชี่ยวชาญที่ทำงานอยู่ ทำให้การคำนวณรวดเร็วมาก

วิวัฒนาการของโมเดล Jamba

Jamba-v0.1 (มีนาคม 2024)

โมเดลแรกที่นำเสนอในตระกูลนี้มีลักษณะดังต่อไปนี้:

ข้อมูลจำเพาะทางเทคนิคของ Jamba-v0.1
ลักษณะ ค่า
จำนวนพารามิเตอร์ทั้งหมด 52 พันล้าน
พารามิเตอร์ที่ใช้งานอยู่ ~12 พันล้าน
จำนวนผู้เชี่ยวชาญ (MoE) 16 (2 ที่ใช้งานอยู่)
หน้าต่าง context 256,000 token
ลิขสิทธิ์ Apache 2.0[4]

ด้วยสถาปัตยกรรมแบบไฮบริด Jamba-1 สามารถประมวลผล context ที่มีความยาว 256,000 token ซึ่งเทียบเท่ากับนิยายประมาณ 400 หน้า และสามารถติดตั้งบน GPU สำหรับผู้บริโภคเพียงตัวเดียวที่มีหน่วยความจำ 80 GB[5]

Jamba-1.5 (2024)

ในปี 2024 AI21 Labs ได้เปิดตัวตระกูลโมเดล Jamba 1.5 ที่อัปเดตแล้ว ซึ่งประกอบด้วยสองเวอร์ชัน ได้แก่ Jamba 1.5 Mini (พารามิเตอร์ที่ใช้งาน 12B จากทั้งหมด 52B) และ Jamba 1.5 Large (พารามิเตอร์ที่ใช้งาน 94B จากทั้งหมด 398B)[6] โมเดลเหล่านี้แสดงให้เห็นถึงการปรับปรุงประสิทธิภาพที่มีนัยสำคัญ:

  • การอนุมานบน context ยาวเร็วขึ้นถึง 2.5 เท่าเมื่อเทียบกับคู่แข่ง
  • รองรับเก้าภาษา รวมถึงภาษาอังกฤษ สเปน ฝรั่งเศส และอาหรับ[7]

ข้อได้เปรียบหลักและประสิทธิภาพ

  • หน้าต่าง context ขนาดใหญ่มาก: 256,000 token — เป็นหนึ่งในหน้าต่างที่ใหญ่ที่สุดในบรรดาโมเดลที่มีอยู่ทั้งหมด (รวมถึงโมเดลที่เป็นกรรมสิทธิ์) ณ เวลาที่เปิดตัว ทำให้ Jamba เหมาะสำหรับงานที่ต้องการวิเคราะห์เอกสารขนาดใหญ่ เช่น สัญญาทางกฎหมาย งานวิจัยทางวิทยาศาสตร์ codebase ทั้งหมด หรือบทสนทนายาว
  • ประสิทธิภาพและความมีประสิทธิผลสูง: ในการทดสอบ Jamba แสดงประสิทธิภาพที่เทียบเคียงหรือเหนือกว่าโมเดลเปิดชั้นนำในขนาดเดียวกัน เช่น Llama และ Mixtral พร้อมทั้งแสดง ปริมาณงานที่สูงกว่า 3 เท่า บน context ยาว[8]
  • ความเปิดกว้างและการเข้าถึง: Jamba เผยแพร่ภายใต้ลิขสิทธิ์ Apache 2.0 ที่อนุญาตอย่างกว้างขวาง ซึ่งเปิดให้ใช้งานอย่างเสรีเพื่อวัตถุประสงค์ทางการค้าและการวิจัย น้ำหนักของโมเดลมีให้บนแพลตฟอร์ม Hugging Face

ผลลัพธ์บน benchmark

Jamba 1.5 แสดงผลลัพธ์ที่แข่งขันได้บน benchmark ต่างๆ[9]:

  • Jamba 1.5 Mini ได้คะแนน 46.1 ใน Arena Hard ทำให้เป็นโมเดลสาธารณะชั้นนำในหมวดหมู่นี้[10]
  • Jamba 1.5 Large ได้คะแนน 65.4 ใน Arena Hard เหนือกว่า Llama 3.1 70B และ 405B

การประยุกต์ใช้และการเข้าถึง

Jamba ได้รับการปรับให้เหมาะสมสำหรับการใช้งานทางธุรกิจและรองรับความสามารถต่างๆ เช่น การเรียกใช้ฟังก์ชัน การแสดงผลแบบมีโครงสร้างใน JSON และการประมวลผลเอกสาร โมเดลนี้มีให้บนแพลตฟอร์มหลายแห่ง รวมถึง:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

เพื่อรองรับการอนุมานที่คุ้มต้นทุน AI21 Labs ได้เปิดตัว ExpertsInt8 — เทคนิค quantization ใหม่ที่ช่วยให้สามารถติดตั้ง Jamba 1.5 Large บนเครื่องที่มี GPU 8 ตัว ขนาด 80GB โดยไม่สูญเสียคุณภาพในการประมวลผล context ขนาด 256K token[11]

เอกสารอ้างอิง

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

หมายเหตุ

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [2]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [3]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]