Jais (language model) (VI)
Jais (đọc là "Jeis") — là một họ mô hình ngôn ngữ lớn (LLM) mã nguồn mở được phát triển tại Các Tiểu vương quốc Ả Rập Thống nhất và được tối ưu hóa đặc biệt cho tiếng Ả Rập[1]. Tên mô hình được đặt theo tên núi Jebel Jais — đỉnh núi cao nhất của UAE[2].
Dự án được tạo ra thông qua sự hợp tác giữa công ty nghiên cứu Inception (công ty con của tập đoàn công nghệ G42), Đại học Trí tuệ Nhân tạo Mohamed bin Zayed (MBZUAI) và công ty sản xuất chip AI Cerebras Systems có trụ sở tại California[2]. Jais được công bố công khai theo giấy phép tự do, nhằm thúc đẩy sự phát triển của hệ sinh thái AI cho tiếng Ả Rập, bảo tồn di sản văn hóa ngôn ngữ và làm cho các công nghệ AI hiện đại trở nên dễ tiếp cận hơn với thế giới nói tiếng Ả Rập[1].
Lịch sử phát triển và các phiên bản
Dự án Jais được khởi xướng vào năm 2023 trong bối cảnh các LLM hiện có còn hạn chế đối với các ngôn ngữ ít tài nguyên. Các nhà phát triển đã chỉ ra sự thiếu hụt các mô hình song ngữ chất lượng cao có khả năng xử lý tốt cả tiếng Ả Rập lẫn tiếng Anh[2].
Jais-13B: Phiên bản đầu tiên
Phiên bản đầu tiên, Jais-13B, được phát hành vào ngày 30 tháng 8 năm 2023 và chứa 13 tỷ tham số[1]. Mô hình được huấn luyện trên một kho ngữ liệu hỗn hợp gồm các văn bản tiếng Anh và tiếng Ả Rập với khối lượng 395 tỷ token[3]. Tại thời điểm ra mắt, nó được gọi là "LLM tiếng Ả Rập chất lượng cao nhất"[1].
Jais-30B: Mở rộng quy mô
Vào ngày 8 tháng 11 năm 2023, chưa đầy ba tháng sau, tập đoàn đã giới thiệu phiên bản thứ hai được cải tiến đáng kể — Jais-30B với 30 tỷ tham số[4]. Việc tăng quy mô xuất phát từ nhu cầu giải quyết các bài toán ứng dụng phức tạp hơn, chẳng hạn như tóm tắt và dịch thuật. Mô hình được huấn luyện trên dataset được mở rộng và làm sạch với khối lượng 1,63 nghìn tỷ token[4].
Jais-70B và họ mô hình
Vào ngày 6 tháng 8 năm 2024, Inception (G42) công bố ra mắt mô hình hàng đầu Jais-70B (70 tỷ tham số) và toàn bộ họ các mô hình liên quan[5]. Jais-70B trở thành LLM mã nguồn mở lớn nhất tập trung vào tiếng Ả Rập. Trong quá trình phát triển, phương pháp continuous training đã được áp dụng: thay vì huấn luyện từ đầu, mô hình Llama 2 70B của Meta được lấy làm nền tảng và tiếp tục được huấn luyện trên 330 tỷ token tiếng Ả Rập. Điều này cho phép chuyển giao hiệu quả kiến thức tiếng Anh từ Llama 2 và tập trung tài nguyên vào việc học tiếng Ả Rập[5].
Kiến trúc và đặc điểm kỹ thuật
Jais thuộc nhóm mô hình transformer tự hồi quy dựa trên kiến trúc GPT-3 (decoder-only). Đặc điểm nổi bật của mô hình là chuyên môn hóa song ngữ về tiếng Ả Rập và tiếng Anh, khác với nhiều LLM đa ngôn ngữ trong đó tiếng Anh chiếm ưu thế. Điều này cho phép đạt được độ hiểu tiếng Ả Rập và các phương ngữ của nó ở mức độ cao[3].
Khi tạo ra Jais, các giải pháp kỹ thuật tiên tiến đã được tích hợp[3]:
- ALiBi positioning: Sơ đồ embedding vị trí đặc biệt cho phép mô hình xử lý ngữ cảnh dài hơn so với ngữ cảnh nó được huấn luyện.
- SwiGLU activation: Hàm kích hoạt giúp nâng cao chất lượng huấn luyện và tính biểu đạt của các tầng mạng nơ-ron.
- Maximal Update Parametrization (µP): Phương pháp điều chỉnh siêu tham số giúp ổn định quá trình huấn luyện khi tăng kích thước mô hình.
- Tokenizer chuyên biệt: Được phát triển có tính đến các đặc điểm của tiếng Ả Rập và tiếng Anh, giúp giảm số lượng token cho văn bản tiếng Ả Rập từ 3–4 lần so với các tokenizer thông thường và tăng tốc độ xử lý[6].
Ngoài các mô hình nền tảng (foundation models), phiên bản Jais-chat đã được phát hành, được fine-tuning thêm trên 9,6 triệu cặp hỏi-đáp để thích nghi với các nhiệm vụ chatbot và trợ lý[3].
Quá trình huấn luyện và bộ dữ liệu
Một trong những nhiệm vụ chính của dự án là chuẩn bị kho ngữ liệu tiếng Ả Rập chất lượng cao và quy mô lớn. Bộ dữ liệu huấn luyện cuối cùng cho Jais-13B gồm 395 tỷ token, trong đó:
- 116 tỷ token (29%) — văn bản tiếng Ả Rập.
- 279 tỷ token (71%) — văn bản tiếng Anh và mã nguồn chương trình.
Thành phần tiếng Ả Rập được cố ý làm cho chiếm tỷ trọng đáng kể (khoảng 30%) để đảm bảo chất lượng thành thạo ngôn ngữ cao[3]. Dữ liệu bao gồm sách, bài báo, trang web và mã nguồn. Để tăng khối lượng văn bản tiếng Ả Rập chất lượng, dịch máy các tài nguyên tiếng Anh đã được áp dụng[3].
Quá trình huấn luyện mô hình được thực hiện trên siêu máy tính Condor Galaxy 1 (CG-1) tại Abu Dhabi, được G42 và Cerebras Systems đồng phát triển. Nhờ cơ sở hạ tầng này, việc huấn luyện Jais-13B chỉ mất khoảng 3,5 ngày thực tế[2].
Ứng dụng và ý nghĩa
Jais được định vị là bước tiến quan trọng trong sự phát triển của AI tạo sinh cho tiếng Ả Rập và các cộng đồng ngôn ngữ khác chưa được đại diện đầy đủ trong các LLM hiện đại. Khả năng truy cập mở vào mô hình nhằm thúc đẩy việc áp dụng các công nghệ xử lý ngôn ngữ tự nhiên ở các khu vực Trung Đông và Bắc Phi.
Kể từ khi ra mắt, dự án đã thu hút sự quan tâm của các cơ quan nhà nước và doanh nghiệp thương mại UAE. Bộ Ngoại giao UAE, công ty dầu khí ADNOC, hãng hàng không Etihad Airways và ngân hàng First Abu Dhabi Bank đã được cấp quyền truy cập sớm vào mô hình[1]. Năm 2024, Microsoft thông báo tích hợp Jais vào nền tảng đám mây Microsoft Azure, giúp mô hình có thể tiếp cận với người dùng toàn cầu[6].
Những người tạo ra Jais nhấn mạnh vai trò của nó trong việc bảo tồn di sản văn hóa ngôn ngữ Ả Rập. Theo lời Giám đốc điều hành của Inception, Andrew Jackson, dự án nhằm "đảm bảo rằng tiếng Ả Rập với di sản phong phú của nó sẽ có tiếng nói trong bức tranh AI"[1]. Kinh nghiệm tích lũy được dự kiến sẽ được sử dụng để tạo ra các LLM tương tự cho các ngôn ngữ và nền văn hóa khác[1].
Tài liệu tham khảo
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Ghi chú
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]