Jais (language model) (TH)
Jais (ออกเสียงว่า «เจส») — คือกลุ่มโมเดลภาษาขนาดใหญ่ (LLM) แบบเปิดที่พัฒนาขึ้นในสหรัฐอาหรับเอมิเรตส์ และได้รับการปรับให้เหมาะสมกับภาษาอาหรับเป็นพิเศษ[1] ชื่อของโมเดลนี้ตั้งตามภูเขาเจเบล เจส ซึ่งเป็นยอดเขาที่สูงที่สุดในสหรัฐอาหรับเอมิเรตส์[2]
โครงการนี้สร้างขึ้นจากความร่วมมือระหว่างบริษัทวิจัย Inception (บริษัทในเครือของกลุ่มเทคโนโลยี G42), มหาวิทยาลัยปัญญาประดิษฐ์โมฮาเหม็ด บิน ซายิด (MBZUAI) และบริษัทผลิตชิป AI จากแคลิฟอร์เนียชื่อ Cerebras Systems[2] Jais ได้รับการเผยแพร่อย่างเปิดเผยภายใต้ใบอนุญาตเสรี ซึ่งมุ่งกระตุ้นการพัฒนาระบบนิเวศ AI สำหรับภาษาอาหรับ โดยอนุรักษ์มรดกทางวัฒนธรรมและภาษา และทำให้เทคโนโลยี AI สมัยใหม่เข้าถึงได้มากขึ้นสำหรับโลกที่ใช้ภาษาอาหรับ[1]
ประวัติการพัฒนาและการเผยแพร่
โครงการ Jais ริเริ่มขึ้นในปี 2023 ท่ามกลางข้อจำกัดของ LLM ที่มีอยู่สำหรับภาษาที่มีทรัพยากรน้อย นักพัฒนาพบว่าขาดแคลนโมเดลสองภาษาที่มีคุณภาพซึ่งสามารถประมวลผลทั้งภาษาอาหรับและภาษาอังกฤษได้ดีพอๆ กัน[2]
Jais-13B: เวอร์ชันแรก
เวอร์ชันแรก Jais-13B เผยแพร่เมื่อ 30 สิงหาคม 2023 และมี 13 พันล้านพารามิเตอร์[1] โมเดลนี้ได้รับการฝึกบน corpus ผสมจากข้อความภาษาอังกฤษและภาษาอาหรับที่มีปริมาณ 395 พันล้าน token[3] ในขณะที่เผยแพร่ได้รับการขนานนามว่าเป็น «LLM ภาษาอาหรับที่มีคุณภาพสูงที่สุด»[1]
Jais-30B: การขยายขนาด
เมื่อ 8 พฤศจิกายน 2023 หรือไม่ถึงสามเดือนต่อมา กลุ่มพันธมิตรได้นำเสนอเวอร์ชันที่สองซึ่งปรับปรุงอย่างมีนัยสำคัญ คือ Jais-30B ที่มี 30 พันล้านพารามิเตอร์[4] การขยายขนาดเกิดจากความจำเป็นในการแก้ปัญหาการประยุกต์ใช้งานที่ซับซ้อนมากขึ้น เช่น การสรุปความและการแปลภาษา โมเดลนี้ได้รับการฝึกบน dataset ที่ขยายและผ่านการคัดกรองแล้วซึ่งมีปริมาณ 1.63 ล้านล้าน token[4]
Jais-70B และกลุ่มโมเดล
เมื่อ 6 สิงหาคม 2024 Inception (G42) ประกาศเปิดตัวโมเดลหลัก Jais-70B (70 พันล้านพารามิเตอร์) และกลุ่มโมเดลที่เกี่ยวข้องทั้งหมด[5] Jais-70B กลายเป็น LLM แบบเปิดที่ใหญ่ที่สุดที่มุ่งเน้นภาษาอาหรับ ในการพัฒนาโมเดลนี้มีการนำวิธี continuous training มาใช้ กล่าวคือ แทนที่จะฝึกจากศูนย์ ได้นำโมเดล Llama 2 70B ของ Meta มาเป็นพื้นฐาน แล้ว fine-tune ต่อด้วย 330 พันล้าน token ในภาษาอาหรับ วิธีนี้ช่วยถ่ายทอดความรู้ภาษาอังกฤษจาก Llama 2 ได้อย่างมีประสิทธิภาพ และทำให้สามารถมุ่งทรัพยากรไปที่การเรียนรู้ภาษาอาหรับได้[5]
สถาปัตยกรรมและคุณลักษณะทางเทคนิค
Jais จัดอยู่ในประเภทโมเดล transformer แบบ autoregressive ที่อิงสถาปัตยกรรม GPT-3 (decoder-only) คุณลักษณะสำคัญของโมเดลคือความเชี่ยวชาญสองภาษาในภาษาอาหรับและภาษาอังกฤษ ซึ่งแตกต่างจาก LLM หลายภาษาทั่วไปที่ภาษาอังกฤษมีอิทธิพลเหนือกว่า สิ่งนี้ช่วยให้สามารถบรรลุความเข้าใจภาษาอาหรับและสำเนียงท้องถิ่นในระดับลึก[3]
ในการสร้าง Jais ได้บูรณาการโซลูชันทางเทคนิคขั้นสูงไว้ด้วยกัน[3]:
- ALiBi positioning: รูปแบบ positional embedding พิเศษที่ช่วยให้โมเดลประมวลผล context ที่ยาวกว่าที่ใช้ฝึกได้
- SwiGLU activation: ฟังก์ชัน activation ที่เพิ่มคุณภาพการฝึกและความสามารถในการแสดงออกของชั้น neural
- Maximal Update Parametrization (µP): เทคนิคการปรับแต่ง hyperparameter ที่ทำให้การฝึกมีเสถียรภาพเมื่อขนาดโมเดลเพิ่มขึ้น
- Tokenizer เฉพาะทาง: พัฒนาขึ้นโดยคำนึงถึงคุณลักษณะของภาษาอาหรับและภาษาอังกฤษ ซึ่งช่วยลดจำนวน token สำหรับข้อความภาษาอาหรับลง 3–4 เท่าเมื่อเทียบกับ tokenizer ทั่วไป และเพิ่มความเร็วในการประมวลผล[6]
นอกจาก foundation model แล้ว ยังได้เผยแพร่เวอร์ชัน Jais-chat ซึ่ง fine-tune เพิ่มเติมบนคู่คำถาม-คำตอบ 9.6 ล้านคู่ เพื่อปรับให้เหมาะกับงาน chatbot และผู้ช่วย[3]
การฝึกและชุดข้อมูล
หนึ่งในภารกิจหลักของโครงการคือการเตรียม corpus ข้อความภาษาอาหรับที่มีคุณภาพสูงและมีขนาดใหญ่ ชุดข้อมูลฝึกสุดท้ายสำหรับ Jais-13B มีทั้งหมด 395 พันล้าน token โดยประกอบด้วย:
- 116 พันล้าน token (29%) — ข้อความภาษาอาหรับ
- 279 พันล้าน token (71%) — ข้อความภาษาอังกฤษและซอร์สโค้ด
ส่วนประกอบภาษาอาหรับถูกตั้งใจให้มีสัดส่วนสำคัญ (ประมาณ 30%) เพื่อให้มั่นใจว่าโมเดลมีทักษะทางภาษาในระดับสูง[3] ข้อมูลรวมถึงหนังสือ บทความข่าว หน้าเว็บ และซอร์สโค้ด สำหรับการเพิ่มปริมาณข้อความภาษาอาหรับที่มีคุณภาพ ได้มีการใช้การแปลด้วยเครื่องจากแหล่งข้อมูลภาษาอังกฤษ[3]
การฝึกโมเดลดำเนินการบนซูเปอร์คอมพิวเตอร์ Condor Galaxy 1 (CG-1) ในอาบูดาบี ซึ่งพัฒนาร่วมกันโดย G42 และ Cerebras Systems ด้วยโครงสร้างพื้นฐานนี้ การฝึก Jais-13B ใช้เวลาสุทธิเพียงประมาณ 3.5 วัน[2]
การประยุกต์ใช้งานและความสำคัญ
Jais ได้รับการวางตำแหน่งให้เป็นก้าวสำคัญในการพัฒนา AI เชิงสร้างสรรค์สำหรับภาษาอาหรับและชุมชนภาษาอื่นๆ ที่ยังมีการนำเสนอไม่เพียงพอใน LLM สมัยใหม่ การเข้าถึงโมเดลแบบเปิดมุ่งกระตุ้นการนำเทคโนโลยีการประมวลผลภาษาธรรมชาติมาใช้ในภูมิภาคตะวันออกกลางและแอฟริกาเหนือ
นับตั้งแต่เปิดตัว โครงการดึงดูดความสนใจจากหน่วยงานภาครัฐและเชิงพาณิชย์ของสหรัฐอาหรับเอมิเรตส์ กระทรวงการต่างประเทศสหรัฐอาหรับเอมิเรตส์ บริษัทน้ำมันและก๊าซ ADNOC สายการบิน Etihad Airways และธนาคาร First Abu Dhabi Bank ได้รับสิทธิ์เข้าถึงโมเดลในช่วงแรก[1] ในปี 2024 Microsoft ประกาศบูรณาการ Jais เข้ากับแพลตฟอร์มคลาวด์ Microsoft Azure ทำให้เข้าถึงได้สำหรับผู้ใช้ทั่วโลก[6]
ผู้สร้าง Jais เน้นย้ำบทบาทของมันในการอนุรักษ์มรดกทางวัฒนธรรมและภาษาอาหรับ ตามคำกล่าวของ Andrew Jackson ประธานเจ้าหน้าที่บริหารของ Inception โครงการนี้มุ่งหมายที่จะ «ทำให้แน่ใจว่าภาษาอาหรับพร้อมมรดกอันอุดมสมบูรณ์จะมีเสียงของตนเองในภูมิทัศน์ของ AI»[1] ประสบการณ์ที่สะสมได้มีแผนนำไปใช้สร้าง LLM ที่คล้ายกันสำหรับภาษาและวัฒนธรรมอื่นๆ[1]
เอกสารอ้างอิง
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
หมายเหตุ
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]