Jamba (language model) (VI)
Jamba — là một họ các mô hình ngôn ngữ lớn (LLM) được phát triển bởi công ty nghiên cứu AI người Israel AI21 Labs. Jamba đại diện cho kiến trúc lai đầu tiên thuộc loại này, kết hợp các yếu tố cốt lõi của hai phương pháp thống trị trong phát triển AI: transformer và mô hình không gian trạng thái (State Space Models, SSM), cụ thể là kiến trúc Mamba[1].
Mục tiêu chính của Jamba là giải quyết sự đánh đổi cơ bản của các LLM hiện đại: chất lượng và hiệu suất cao (đặc trưng của transformer) so với hiệu quả và khả năng xử lý ngữ cảnh siêu dài (đặc trưng của SSM). Bằng cách kết hợp các phương pháp này và bổ sung độ thưa thớt thông qua Mixture-of-Experts (MoE), Jamba mang lại một mô hình vừa mạnh mẽ, vừa hiệu quả và có khả năng xử lý khối lượng văn bản khổng lồ trong một yêu cầu duy nhất.
Kiến trúc Jamba chi tiết
Jamba không chỉ đơn giản xen kẽ các lớp transformer và Mamba. Nó sử dụng cấu trúc khối được thiết kế cẩn thận, trong đó mỗi khối bao gồm tám lớp.
Cấu trúc một khối Jamba:
- Một lớp Transformer: Lớp này chịu trách nhiệm về khả năng hiểu "sâu" và suy luận phức tạp. Kiến trúc Mixture-of-Experts (MoE) được tích hợp vào lớp này.
- Bảy lớp Mamba: Các lớp này theo sau lớp transformer và chịu trách nhiệm xử lý chuỗi hiệu quả và "truyền dẫn" thông tin qua ngữ cảnh dài[2].
Cấu trúc bất đối xứng này cho phép mô hình quản lý tài nguyên tính toán hiệu quả: các phép tính transformer nặng nhưng mạnh mẽ được thực hiện ít thường xuyên hơn, trong khi các phép tính Mamba nhẹ và nhanh được thực hiện thường xuyên hơn.
Tích hợp Mixture-of-Experts (MoE)
Jamba sử dụng kiến trúc MoE để nâng cao hiệu quả hơn nữa.
- MoE được áp dụng chỉ cho các khối kết nối đầy đủ (FFN) bên trong các lớp transformer[3]. Các lớp Mamba vẫn giữ dạng dày đặc.
- Trong mô hình Jamba đầu tiên có 16 chuyên gia.
- Đối với mỗi token, mạng định tuyến chọn 2 chuyên gia tốt nhất (Top-2 gating).
Điều này có nghĩa là mặc dù tổng số tham số của mô hình là lớn (52 tỷ), nhưng ở mỗi bước xử lý token trong lớp transformer, chỉ có 2 trong số 16 chuyên gia được kích hoạt, giúp cho quá trình tính toán diễn ra rất nhanh.
Sự tiến hóa của các mô hình Jamba
Jamba-v0.1 (tháng 3 năm 2024)
Mô hình đầu tiên được giới thiệu trong họ này có các đặc điểm sau:
| Đặc điểm | Giá trị |
|---|---|
| Tổng số tham số | 52 tỷ |
| Tham số hoạt động | ~12 tỷ |
| Số lượng chuyên gia (MoE) | 16 (2 hoạt động) |
| Cửa sổ ngữ cảnh | 256 000 token |
| Giấy phép | Apache 2.0[4] |
Nhờ kiến trúc lai của mình, Jamba-1 có thể xử lý ngữ cảnh dài 256 000 token, tương đương khoảng một cuốn tiểu thuyết 400 trang, và có thể được triển khai trên một GPU người dùng phổ thông có 80 GB bộ nhớ[5].
Jamba-1.5 (2024)
Năm 2024, AI21 Labs giới thiệu họ mô hình Jamba 1.5 được cập nhật, bao gồm hai phiên bản: Jamba 1.5 Mini (12 tỷ tham số hoạt động trên tổng số 52 tỷ) và Jamba 1.5 Large (94 tỷ tham số hoạt động trên tổng số 398 tỷ)[6]. Các mô hình này thể hiện những cải tiến đáng kể về hiệu suất:
- Tốc độ suy luận nhanh hơn tới 2,5 lần trên ngữ cảnh dài so với các đối thủ cạnh tranh.
- Hỗ trợ chín ngôn ngữ, bao gồm tiếng Anh, tiếng Tây Ban Nha, tiếng Pháp và tiếng Ả Rập[7].
Ưu điểm chính và hiệu suất
- Cửa sổ ngữ cảnh khổng lồ: 256 000 token — một trong những cửa sổ lớn nhất trong tất cả các mô hình hiện có (bao gồm cả các mô hình độc quyền) tại thời điểm phát hành. Điều này làm cho Jamba trở nên lý tưởng cho các tác vụ đòi hỏi phân tích tài liệu lớn: hợp đồng pháp lý, công trình khoa học, toàn bộ cơ sở mã nguồn hoặc các hội thoại dài.
- Hiệu suất và hiệu quả cao: Trong các bài kiểm tra, Jamba thể hiện hiệu suất tương đương hoặc vượt trội so với các mô hình mã nguồn mở hàng đầu có kích thước tương tự, chẳng hạn như Llama và Mixtral, đồng thời cho thấy thông lượng cao hơn gấp 3 lần trên ngữ cảnh dài[8].
- Tính mở và khả năng tiếp cận: Jamba được phân phối theo giấy phép cho phép Apache 2.0, cho phép sử dụng tự do cho mục đích thương mại và nghiên cứu. Trọng số mô hình có sẵn trên nền tảng Hugging Face.
Kết quả trên các benchmark
Jamba 1.5 cho thấy kết quả cạnh tranh trên nhiều benchmark khác nhau[9]:
- Jamba 1.5 Mini đạt 46,1 điểm trong Arena Hard, khiến nó trở thành mô hình công khai dẫn đầu trong hạng mục của mình[10].
- Jamba 1.5 Large đạt 65,4 điểm trong Arena Hard, vượt trội so với Llama 3.1 70B và 405B.
Ứng dụng và khả năng tiếp cận
Jamba được tối ưu hóa cho các ứng dụng doanh nghiệp và hỗ trợ các tính năng như gọi hàm, xuất cấu trúc JSON và xử lý tài liệu. Mô hình có sẵn trên nhiều nền tảng, bao gồm:
- Hugging Face
- Google Cloud Vertex AI
- Microsoft Azure
- NVIDIA API catalog
- Amazon Bedrock[9]
- AI21 Studio
Để hỗ trợ suy luận tiết kiệm chi phí, AI21 Labs đã giới thiệu ExpertsInt8 — một kỹ thuật lượng tử hóa mới cho phép triển khai Jamba 1.5 Large trên máy có 8 GPU 80GB mà không làm giảm chất lượng khi xử lý ngữ cảnh 256K token[11].
Tài liệu tham khảo
- Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
- Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
- Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
- Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.
Ghi chú
- ↑ «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
- ↑ Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
- ↑ «Jamba Documentation». Hugging Face Transformers. [2]
- ↑ «ai21labs/Jamba-v0.1». Hugging Face. [3]
- ↑ «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
- ↑ «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
- ↑ «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
- ↑ «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
- ↑ 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
- ↑ «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
- ↑ «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]